Skip to main content

System-Überwachung & Analyse

eEVOSMit den eEVOS-Monitoringfunktionen überwachen Sie einzelne Systeme und Cluster im laufenden Betrieb. Für tägliche Kontrollen stehen die integrierten Dashboards zur Verfügung. Prometheus, REST API und Ansible eignen sich für detaillierte Abfragen und die zentrale Überwachung mehrerer Installationen.

Monitoringmöglichkeiten im Überblick

MethodeGeeignet fürZugriff
eEVOS-DashboardsTägliche Kontrolle und DiagrammeNormale GUI-Anmeldung
PrometheusMetriken, Kapazitätsanalyse und PromQLhttps://<eevos-adresse>/prometheus/ nach GUI-Anmeldung
REST APIStrukturierte Zustands-, Inventar- und JobdatenAPI-Schlüssel über https://<eevos-adresse>:18443/api/v1/
AnsibleWiederholbare Prüfungen auf mehreren SystemenSeparater Control-Node über SSH oder REST API
AlarmeProaktive Meldung von Dienst- und KapazitätsproblemenKonfigurierter Benachrichtigungskanal

Integrierte Webüberwachung

  1. Melden Sie sich an der eEVOS-Administrationsoberfläche an.
  2. Öffnen Sie Statistics.
  3. Wählen Sie IO Stats, VM Statistics oder Ceph Stats.
  4. Stellen Sie den Zeitraum ein und vergleichen Sie alle Cluster-Knoten.
  5. Untersuchen Sie dauerhaft hohe Werte, deutliche Abweichungen, fehlende Messreihen und unerwartete Nullwerte.

eEVOS System-Dashboard

Das System-Dashboard bietet Ihneneinen umpfangreicheschnellen MöglichkeitenÜberblick über Zustand und Auslastung.

eEVOS Performance-Monitoring

möglicheProblemerechtzeitig
BereichDarauf sollten Sie achten
CPU und LoadDauerhafte Auslastung, plötzliche Änderungen oder einen Knoten, der stärker belastet ist.
ArbeitsspeicherWenig verfügbaren Speicher, steigenden Verbrauch oder Unterschiede zwischen Knoten.
Datenträger und NetzwerkHohe I/O-Wartezeit, dauerhaft ausgelastete Verbindungen oder inaktive Schnittstellen.
Virtuelle MaschinenCPU-, Speicher-, Block-I/O- und Netzwerkverhalten einzelner VMs.
CephOSDs, die Systemnutzungnicht zuup/in analysierensind, degradierte Placement Groups, Recovery, Latenz und soKapazität.
zu

Prometheus lösen.verwenden

Prometheus sammelt Zeitreihendaten der System-, VM- und Ceph-Exporter. Öffnen Sie Prometheus ausschließlich über den eEVOS-Proxy. Der lokale Prometheus-Port sollte nicht direkt in ungeschützte Netze veröffentlicht werden.

  1. Melden Sie sich an der eEVOS-Oberfläche an.
  2. Öffnen Sie im selben Browser https://<eevos-adresse>/prometheus/.
  3. Verwenden Sie Query für Abfragen, Alerts für Alarme und Status → Targets für den Exporter-Zustand.

Die wichtigsten sindPrometheus-Abfrage in eEVOS

SystemNützliche DashboardPrometheus-Abfragen

ZweckPromQL
Erreichbarkeit aller Exporterup
Systemlastnode_load1
Verfügbarer Speicher in Prozent100 * node_memory_MemAvailable_bytes / node_memory_MemTotal_bytes
Nicht im Leerlauf verbrauchte CPU100 * (1 - avg by(instance) (rate(node_cpu_seconds_total{mode="idle"}[5m])))
Ceph-OSD-Zustandceph_osd_up
Verwendete Ceph-Kapazitätceph_cluster_used_bytes

SystemMetriknamen Dashboardkönnen zeigtje aktuellennach SystemstatusEdition und meldetExporterversion möglicheabweichen. ProblemePrüfen Sie die tatsächlich vorhandenen Namen über die Metriksuche.

REST API für Monitoring konfigurieren

  1. Öffnen Sie System Settings → API Configuration.
  2. Aktivieren Sie den externen REST-API-Zugriff.
  3. Wählen Sie ein erreichbares Verwaltungsnetz. Localhost only ist extern nicht erreichbar.
  4. Verwenden Sie HTTPS und standardmäßig Port 18443.
  5. Erstellen Sie einen eigenen API-Benutzer mit starkem Schlüssel und möglichst schreibgeschützter Rolle.
  6. Legen Sie Ablaufdatum und Rate Limit fest.
  7. Aktivieren Sie Swagger/OpenAPI nur bei Bedarf.
  8. Speichern Sie den Schlüssel in Roteinem (kritischeSecrets Meldungen)Manager.

REST-API-Einstellungen in eEVOS

Zugriff testen

export EEVOS_URL="https://<eevos-adresse>:18443"
export EEVOS_API_KEY="<api-schlüssel>"

curl --fail --silent --show-error   -H "X-API-Key: $EEVOS_API_KEY"   "$EEVOS_URL/health"

REST-Clients verwenden X-API-Key. Der GUI-Sitzungscookie ist für die REST API nicht geeignet.

Schreibgeschützter EndpunktVerwendung
/healthZustand des API-Dienstes
/api/v1/product/capabilitiesInstallierte Produktfunktionen
/api/v1/cluster/monitorZusammenfassung des Clusterzustands
/api/v1/vms/status-quickKompakte VM-Zustandsübersicht
/api/v1/vms/with-statsVM-Inventar mit Laufzeitdaten
/api/v1/jobsZustand asynchroner Aufträge

Monitoring mit Ansible

Verwenden Sie einen separaten Ansible-Control-Node. Für einen Cluster genügt normalerweise eine Manager-Adresse. Speichern Sie Passwörter und OrangeAPI-Schlüssel (Warnungen)in Ansible Vault und nicht im Inventar.

Analyse
ansible-playbook Dashboard

--syntax-check

Analysemonitor-eevos.yml Dashboardansible-playbook --check monitor-eevos.yml

  • Verwenden Sie Leseoperationen für regelmäßige Monitoringläufe.
  • Prüfen Sie neue Playbooks zuerst mit Syntaxprüfung und Check Mode.
  • Verwenden Sie pro Monitoring-System eigene Zugangsdaten.
  • Begrenzen Sie Abfragehäufigkeit und Parallelität.

Alarme und Prüfintervalle

  • Prüfen Sie unter Prometheus → Alerts den Regelzustand.
  • Stellen Sie sicher, dass Alertmanager und Empfänger erreichbar sind.
  • Trennen Sie Warnungen und kritische Meldungen, wenn unterschiedliche Reaktionen erforderlich sind.
  • Senden Sie nach Einrichtung, Upgrades und Zertifikatsänderungen eine Testmeldung.
  • Speichern Sie keine Zugangsdaten in Alarmtexten.
InformationTypisches Intervall
API-Zustand und Exporter up1–5 Minuten
CPU, Speicher, Datenträger und Netzwerk1–5 Minuten
VM-Laufzeitzustandetwa 5 Minuten
Ceph Health, OSDs und Placement Groups1–5 Minuten
Kapazitätstrendstündlich oder täglich

Fehlerbehebung

nützlich
ProblemPrüfung und Maßnahme
Prometheus leitet zur Anmeldung umMelden Sie sich zuerst an der GUI an und öffnen Sie den Proxy im selben Browser.
Ein Target ist sehrdown Prüfen umSie dasStatus System→ Targets, lastError, den Knoten, Exporterdienst, DNS und Firewall.
Dashboard enthält LückenPrüfen Sie Prometheus-Bereitschaft, Target-Zustand, Zeitsynchronisierung und Dienstprotokolle.
REST funktioniert nur lokalPrüfen Sie Listen Network, Firewall, Routing und den externen API-Zugriff.
REST antwortet mit 401 oder 403Prüfen Sie API-Schlüssel, Rolle, Ablaufdatum und Schlüsselrotation.
REST antwortet mit 429Reduzieren Sie die Abfragehäufigkeit.

Tägliche Checkliste

  • Alle erwarteten Prometheus-Targets melden up.
  • Alle Knoten liefern aktuelle Systemdaten.
  • Ceph-OSDs und Placement Groups sind fehlerfrei.
  • Keine unerwarteten kritischen Alarme sind offen.
  • REST /health antwortet und Zugangsdaten laufen nicht kurzfristig ab.
  • Aufträge hängen nicht dauerhaft in Echtzeitrunning.
  • zu
  • VM- analysieren

    und

    VMBalancing-Zustand Statistiken

    entsprechen den Erwartungen.
  • Die Kapazität bietet Reserve für Ausfälle und Wartung.

Sicherheit

VMVerwenden StatistikenSie zeigenden IhnenGUI-Sitzungscookie nur für den Prometheus-Proxy und einen eigenen API-Schlüssel für REST. Beschränken Sie den Zugriff auf Verwaltungsnetze, prüfen Sie TLS-Zertifikate und wechseln Sie Zugangsdaten regelmäßig. Veröffentlichen Sie Prometheus, Exporter oder die System-NutzungREST derAPI einzelnennicht virtuellendirekt Maschinen.in Innicht Formvertrauenswürdige von Grafiken für Langzeit-Analyse oder der Echtzeit-AnalyseNetze.