Info2soft verwendet Cookies, um Ihnen ein besseres und angenehmeres Surferlebnis auf unserer Website zu ermöglichen. Datenschutzerklärung
Wird geladen...
Die meisten VMware-Umgebungen scheinen einwandfrei zu funktionieren – bis plötzlich Probleme auftreten. Ein Host reagiert nicht mehr, ein Datenspeicher läuft voll oder die Leistung virtueller Maschinen verschlechtert sich tagelang unbemerkt.
Eine gute VMware-Überwachung erkennt diese Probleme, bevor sie zu Störfällen führen. Dieses Handbuch behandelt die wichtigsten zu verfolgenden Metriken, die Einrichtung eines praktischen Überwachungsworkflows und die Tools, die 2026 für vSphere-Umgebungen am besten geeignet sind.
Die VMware-Überwachung ist der kontinuierliche Vorgang zur Verfolgung von ESXi-Hosts, vCenter Server sowie den virtuellen Maschinen, auf denen Ihre Anwendungen ausgeführt werden.
In einer gemeinsam genutzten virtualisierten Umgebung bleiben Probleme nicht auf einen Bereich beschränkt. Eine einzelne überlastete virtuelle Maschine kann einen gesamten Host ausbremsen, und ein voll laufender Datenspeicher kann mehrere Workloads gleichzeitig offline schalten. Die Überwachung verschafft Ihnen den Überblick, um diese Probleme zu erkennen, bevor sie eskalieren.
Seit der Übernahme durch Broadcom sind die Anforderungen gestiegen. Viele Unternehmen sehen sich mit höheren Lizenzkosten konfrontiert und stehen unter größerem Druck, die Ressourcennutzung zu optimieren.
Aus diesen Gründen ist die VMware-Überwachung wichtiger denn je. Sie ist nicht nur eine bewährte Vorgehensweise, sondern ein zentraler Bestandteil zur Aufrechterhaltung von Leistung, Verfügbarkeit und Kosteneffizienz Ihrer gesamten VMware-Umgebung.
Der Aufbau eines stabilen Überwachungsgerüsts erfordert eine mehrschichtige Strategie. Eine einzelne Metrik kann den vollständigen Gesundheitszustand eines verteilten Systems nicht abbilden. Sie müssen Hypervisor-Ebenen-Daten mit Informationen kombinieren, die das tatsächliche Geschehen innerhalb jeder virtuellen Maschine zeigen.
Die Leistungsdiagramme im vSphere Client sind Ihr Ausgangspunkt. Es ist keine zusätzliche Software erforderlich. Navigieren Sie zu einer beliebigen virtuellen Maschine oder einem Host und wählen Sie Überwachung > Leistung > Erweitert, um Echtzeit- und historische Daten abzurufen.
Mithilfe dieser Diagramme können Sie bis zu drei Metriken gleichzeitig vergleichen und zwischen gestapelten und überlagerten Ansichten wechseln – hilfreich, um Zusammenhänge wie CPU-Spitzen in Verbindung mit Speicherlatenz zu erkennen.
Die VMware-API bietet einen guten Überblick auf Hypervisor-Ebene, kann jedoch nicht in das Innere virtueller Maschinen blicken. Für ein vollständiges Bild kombinieren Sie Hypervisor-Metriken mit Daten aus den Gastbetriebssystemen.
Verwenden Sie WMI für Windows-Server sowie SNMP oder SSH für Linux-Hosts. Dadurch lassen sich die Werte des Hypervisors mit den tatsächlichen Bedingungen abgleichen, die die Anwendungen im Gastbetriebssystem erfahren.
Statische Schwellenwerte können irreführend sein. Eine CPU-Auslastung von 90 % kann für einen SQL-Server während eines Sicherungsfensters normal sein, bei einem Web-Gateway jedoch ein Warnsignal darstellen.
Nutzen Sie nach Möglichkeit Tools mit KI- oder ML-Funktionen, um das „normale“ Verhalten jedes Workloads zu erlernen. Dadurch werden Fehlalarme reduziert und nur Warnungen angezeigt, die tatsächlich Aufmerksamkeit erfordern.
Nachdem Baselines erstellt wurden, richten Sie Warnungen für bekannte Leistungsprobleme ein. Die meisten Administratoren beginnen mit diesen Schwellenwerten:
Vermeiden Sie ständiges Wechseln zwischen Tools und Registerkarten. Ein einzelnes Dashboard, das Daten von Hosts, virtuellen Maschinen und Datenspeichern zusammenfasst, erleichtert das Erkennen clustereweiter Muster – wie erhöhte Latenz im gesamten Cluster – die bei der Betrachtung einzelner virtueller Maschinen verborgen bleiben würden.
Wenn Sie VDI-Workloads verwalten, fügen Sie Ihrem Dashboard einen Bereich zur Überwachung von VMware Horizon hinzu. Die Verfolgung der Erfolgsrate von Sitzungsverbindungen zusammen mit dem Host-Zustand hilft Ihnen, schnell zwischen Netzwerk- und Serverproblemen zu unterscheiden.
Manuelle Reaktionen sind für die meisten Produktionsstörfälle zu langsam. Der letzte Schritt eines ausgereiften Überwachungssystems ist die Verknüpfung von Warnungen mit automatisierten Aktionen – sei es das Erstellen eines Tickets in Ihrer ITSM-Plattform oder das Auslösen eines PowerCLI-Skripts zur Erweiterung des Speichers oder zur Verschiebung einer belasteten virtuellen Maschine per vMotion.
Ein stabiler vSphere-Betrieb erfordert mehr als nur die Prüfung der Online-Verfügbarkeit von Hosts. Leistungsstarke Teams verfolgen spezifische Metriken, die zeigen, wie effizient der Hypervisor gemeinsam genutzte Ressourcen verwaltet.
In virtualisierten Umgebungen geht es bei der CPU-Leistung um mehr als Auslastungsprozentsätze. Die wichtigere Frage ist, ob virtuelle Maschinen ausgeführt werden können, sobald sie Rechenkapazität benötigen.
vSphere nutzt mehrere Verfahren, um ungenutzten RAM von virtuellen Maschinen zurückzugewinnen. Dadurch ist die Speicherüberwachung differenzierter als bei physischen Servern.
Der Speicher ist einer der häufigsten Leistungsengpässe in virtualisierten Umgebungen. Überwachen Sie sowohl den Durchsatz als auch die Wartezeit.
Die Fehlerbehebung bei virtuellem Netzwerkverkehr ist schwierig, da ein Großteil des Datenverkehrs den physischen Host niemals verlässt.
Auf Clusterebene benötigen Sie den Überblick über die Lastverteilung und die Funktionsweise Ihrer Ausfallsicherheitsmechanismen.
Schnellreferenz: Metrik-Schwellenwerte
Diese Schwellenwerte werden üblicherweise als Ausgangsbasis verwendet. Die passenden Werte hängen jedoch von Ihren Workloads und dem eingesetzten Speichertyp ab.
| Metrik | Warnung | Kritisch |
|---|---|---|
| CPU-Bereitschaftszeit | 3 % | 5 % |
| Speicherlatenz (GAVG) | 20 ms | 30 ms |
| Nutzung des Datenspeichers | 80 % | 90 % |
| Speicherauslagerungsrate | > 0 Kbit/s | > 500 Kbit/s |
| Verlorene Netzwerkpakete | 1 % | 5 % |
Das richtige Überwachungstool hängt von der Größe Ihres Teams, den technischen Kenntnissen und dem Budget ab. Einige Unternehmen kommen vollständig mit den nativen vSphere-Tools aus. Andere benötigen Drittanbieter-Plattformen für einen tieferen Einblick in ESXi-Hosts oder Hybrid-Cloud-Umgebungen.
Die meisten Administratoren beginnen mit den Tools, die in ihrer vSphere-Lizenz enthalten sind.
Drittanbieter-Tools bieten üblicherweise eine breitere Integration mit Nicht-VMware-Infrastruktur – wie physischen Speicherarrays oder Public-Cloud-Plattformen – und verfügen oft über flexiblere Dashboards und Warnoptionen.
| Tool | Einsatzbereich | Kernfunktion |
|---|---|---|
| PRTG | Mittelständische Teams | Überwachung von CPU, Speicher und Datenspeicherkapazität über ein zentrales Dashboard |
| Datadog | Hybrid-Cloud | Vereinheitlichte Echtzeit-Dashboards für Cloud- und On-Premises-VMware-Metriken |
| SolarWinds VMAN | Kapazitätsplanung | Empfehlungen zur passenden Dimensionierung virtueller Maschinen und szenariobasierte Kapazitätsplanung |
| ManageEngine OpManager | Automatisierung und Compliance | Kombiniert Leistungsüberwachung, Kapazitätsplanung und Compliance-Prüfungen |
| Netdata | Open-Source mit hoher Detailtiefe | Sekundengenaue Erfassung von Metriken für ESXi-Hosts, virtuelle Maschinen, Datenspeicher und virtuelle Schnittstellen |
| Veeam ONE | Sicherung und Überwachung | Kombiniert Echtzeit-Leistungswarnungen mit Einblick in den Status von Sicherungsaufträgen |
Auswahlkriterien:
Drei Faktoren bestimmen üblicherweise, welches Tool geeignet ist:
Die passenden Tools allein reichen nicht aus. Die Konfiguration und Pflege Ihrer Überwachungsstrategie entscheidet darüber, ob Sie Probleme früh erkennen oder nachträglich Ausfälle erklären müssen.
Eine deutliche Leistungsspitze kann innerhalb von weniger als 60 Sekunden auftreten und wieder abklingen. Wenn Ihr Überwachungstool nur alle fünf Minuten Daten abfragt, taucht dieses Ereignis niemals in Ihren Auswertungen auf – Sie können Nutzerbeschwerden anschließend nicht nachvollziehen.
Die meisten modernen Überwachungstools bieten Abfrageintervalle von 30 Sekunden. Sollte Ihr Tool dies nicht unterstützen, prüfen Sie, ob es den Anforderungen einer produktiven vSphere-Umgebung gerecht wird.
Die voreingestellten Warnschwellenwerte passen selten zu Ihren spezifischen Workloads. Ein Domänencontroller und ein Videorendering-Server weisen völlig unterschiedliche normale CPU-Verläufe auf.
Beobachten Sie jeden Workload mindestens zwei Wochen lang, bevor Sie individuelle Schwellenwerte konfigurieren. Dadurch werden Fehlalarme reduziert und sichergestellt, dass Warnungen das tatsächliche Verhalten der Anwendungen widerspiegeln und keine generischen Standardwerte.
Nicht jedes Problem erfordert eine sofortige Reaktion. Ein zweistufiges System hilft Ihrem Team bei der Priorisierung:
Eingeschaltete, nicht aktiv genutzte virtuelle Maschinen belegen CPU, Speicher und Festplatten – bei lizenzbasierten Abrechnungsmodellen erhöhen sie zudem Ihre Kosten unnötig.
Prüfen Sie regelmäßig Ihr vCenter-Inventar auf virtuelle Maschinen mit nahezu null CPU-Auslastung und ohne Festplattenaktivität über einen Zeitraum von 30 Tagen. Die Außerbetriebnahme ungenutzter Workloads gibt Ressourcen frei und senkt Ihren Lizenzbedarf.
Einige Drittanbieter-Überwachungstools berechnen Kosten nach Sockel- oder VM-Anzahl. Bei der Skalierung oder Konsolidierung Ihrer Umgebung stellen Sie sicher, dass Ihre Überwachungskosten nicht schneller steigen als Ihre Infrastruktur.
Prüfen Sie, wie die laufenden Lizenzaktualisierungen von Broadcom sowohl Ihr VMware-Stack als auch die darauf aufsetzenden Drittanbieter-Tools beeinflussen.
Die Überwachung zeigt Ihnen, wann Fehler auftreten – sie stellt verlorene Daten jedoch nicht wieder her.
Viele IT-Teams investieren stark in Überwachungstools, betrachten Sicherungen jedoch als Nebenaspekt. Dies ist eine gefährliche Lücke. In einer VMware-Umgebung erfordert eine echte Sicherungsstrategie eine separate, unabhängige Kopie Ihrer Daten, die unabhängig von Störungen der Produktionsumgebung wiederhergestellt werden kann.
Hier kommt eine dedizierte Sicherungslösung ins Spiel. i2Backup ist eine Unternehmenssicherungsplattform zum Schutz von VMware-Umgebungen sowie physischen Servern, Datenbanken und unstrukturierten Daten – alles über eine zentrale Verwaltungskonsole.
Für Teams, die über reine Sicherungen hinausgehende Lösungen benötigen, bietet Info2soft zudem i2Availability an – eine Hochverfügbarkeitslösung mit Echtzeit-Replikation und automatisiertem Failover für VMware und weitere virtualisierte Umgebungen. Sie hilft Ihnen, sowohl RPO als auch RTO bei Produktionsausfällen zu minimieren.
Überwachung und Sicherung funktionieren am besten als Kombination: Die Überwachung warnt Sie frühzeitig, die Sicherung bietet Ihnen einen Wiederherstellungsweg. Zusammen bilden sie die Grundlage einer ausfallsicheren VMware-Umgebung.
Eine effektive VMware-Überwachung ist keine einmalige Einrichtung, sondern eine dauerhafte Aufgabe. Sie erfordert die passenden Metriken, geeignete Tools und eine Strategie, die mit Ihrer Umgebung wächst.
Beginnen Sie mit den Grundlagen: Verfolgen Sie CPU-Bereitschaftszeit, Speicherbelastung, Speicherlatenz und Netzwerkzustand über alle ESXi-Hosts und virtuellen Maschinen hinweg. Erstellen Sie Baselines vor der Festlegung von Schwellenwerten, nutzen Sie mehrstufige Warnungen zur Reduzierung von Störmeldungen und prüfen Sie regelmäßig ungenutzte Ressourcen, die Ihre Kosten unbemerkt erhöhen.
Wenn Ihre Umgebung skaliert oder sich Ihre Lizenzbedingungen ändern, überprüfen Sie Ihre eingesetzten Tools erneut. Was für einen Cluster mit 10 Hosts funktioniert, reicht für eine mehrstandortige Umgebung mit Hybrid-Cloud-Erweiterungen möglicherweise nicht aus.
Und denken Sie daran: Die Überwachung zeigt Ihnen Fehler, kann aber keine bereits verlorenen Daten wiederherstellen. Die Kombination einer durchdachten Überwachungsstrategie mit einer zuverlässigen Sicherungslösung wie i2Backup von Info2soft stellt sicher, dass Übersicht und Wiederherstellbarkeit Hand in Hand arbeiten – nicht isoliert voneinander.