Server-Monitoring ist die laufende, automatisierte Überwachung von Zustandswerten eines Servers, etwa Festplattengesundheit, RAID-Status, Speicherbelegung, Temperatur und Erreichbarkeit, mit dem Ziel, Störungen zu melden, bevor sie den Betrieb treffen. Der Unterschied zum gelegentlichen Blick ins Ereignisprotokoll: Das Monitoring schaut jede Minute hin, vergleicht mit festen Schwellen und meldet sich von allein. Dieser Beitrag zeigt, welche Werte für einen kleinen Serverraum zählen, wie Serverraum-Überwachung und Rack-Monitoring dazugehören und wie die Einführung in sechs Schritten abläuft.
Auf einen Blick
- Zehn Messwerte decken den Großteil der vermeidbaren Serverausfälle ab: SMART, RAID-Status, Speicherbelegung, CPU- und RAM-Last, Temperatur, Erreichbarkeit, Dienste, Backup-Ziel, Zertifikate und Firmware-Stand.
- Beispielhafte Warnschwellen: Speicherbelegung ab 80 Prozent, Zertifikats-Restlaufzeit unter 30 Tagen, Raumtemperatur über 27 Grad, kein neuer Sicherungssatz seit 24-48 Stunden.
- Serverraum-Überwachung ergänzt den Blick in den Server um Temperatur, Luftfeuchte, Strom und USV sowie Zutritt; Rack-Monitoring bringt die Sensoren direkt in den Schrank.
- Vier Wege führen zum Ziel: Hersteller-Tools wie iDRAC und iLO, Plattformen wie PRTG oder Checkmk, eine Appliance oder Managed Monitoring, und als Notlösung die manuelle Sichtkontrolle.
- Die Einführung dauert bei bis zu zehn Systemen in der Regel 2-4 Wochen inklusive Probelauf; der größte Aufwand liegt im Justieren der Schwellen und Zuständigkeiten, nicht in der Technik.
- Monitoring meldet, es repariert nicht: Ohne eine Person oder einen Dienstleister, der auf Meldungen reagiert, bleibt jede Warnung wirkungslos.
Welche Werte gehören ins Server-Monitoring?
Der Server ist nicht abgestürzt. Er ist langsam gestorben. Die erste Festplatte im RAID meldete seit sieben Wochen einen SMART-Warnstatus, die zweite seit vier. Niemand hat es gesehen, weil niemand hinsah: Das Hersteller-Tool zeigte die gelbe Markierung nur beim Login, und das machte seit dem Weggang des Kollegen niemand mehr. Als die zweite Platte ausfiel, stand das Array. Die Wiederherstellung dauerte zwei Arbeitstage, weil auch das Sicherungsziel seit Wochen voll war. So sieht der Normalfall eines ungeplanten Ausfalls in kleinen Umgebungen aus.
Was hätte gemeldet werden müssen? Die Werte in der folgenden Tabelle. Die Schwellen sind Beispiele und müssen an Hardware, Auslastung und Wartungsfenster Ihrer Umgebung angepasst werden.
| Messwert | Warnschwelle (Beispiel) | Was passiert, wenn niemand hinsieht |
|---|---|---|
| SMART-Werte der Laufwerke | Erste neu zugewiesene oder schwebende Sektoren, SSD-Restlebensdauer unter 20 Prozent | Das Laufwerk fällt Wochen später aus; im RAID ohne Redundanz droht Datenverlust. Details unter Festplatte voll oder SMART-Warnung. |
| RAID-Status | Array nicht mehr 'Optimal', ein Laufwerk länger als 24 Stunden 'Degraded' | Ein zweiter Plattenausfall stoppt das Array; dann hilft nur noch das Backup. |
| Speicherbelegung | Warnung ab 80 Prozent, kritisch ab 90 Prozent | Datenbanken und Mail-Dienste stoppen, Updates schlagen fehl. |
| CPU- und RAM-Last | Über 85 Prozent länger als 15 Minuten außerhalb von Wartungsfenstern | Anwendungen werden träge, die Ursache bleibt unentdeckt. |
| Temperatur (CPU, Laufwerke, Gehäuse) | CPU über 80 Grad, Laufwerke über 50 Grad, Gehäuse über 35 Grad | Thermische Drosselung, verkürzte Lebensdauer, im Extremfall Notabschaltung. |
| Erreichbarkeit (Ping, Ports) | Drei fehlgeschlagene Prüfungen in Folge im Minutenabstand | Der Ausfall wird erst gemeldet, wenn Mitarbeiter nicht mehr arbeiten können. |
| Dienste und Prozesse | Definierter Dienst nicht 'Running', mehr als drei Neustarts pro Stunde | Mailfluss, Datenbank oder Freigabe stehen still, obwohl der Server läuft. |
| Backup-Ziel | Kein neuer Sicherungssatz seit 24-48 Stunden, Ziel nicht erreichbar oder über 90 Prozent voll | Die Sicherung läuft wochenlang ins Leere. Mehr im Beitrag zum Backup-Monitoring. |
| Zertifikate | Restlaufzeit unter 30 Tagen, erneut bei 14 und 7 Tagen | Browser-Warnungen, abgebrochene VPN-Verbindungen, Mail-Verschlüsselung bricht ab. |
| Firmware- und Patch-Stand | Sicherheitsrelevantes Hersteller-Update länger als 30 Tage offen | Bekannte Schwachstellen und längst behobene Controller-Fehler bleiben bestehen. |
Fällt Ihnen auf, dass CPU-Last erst an vierter Stelle steht? Das ist Absicht. In kleinen Umgebungen sterben Server selten an Überlast, sondern an Speichermedien, vollen Volumes und Sicherungen, die niemand prüft. Dazu gleich mehr.
Was ist Server-Monitoring und was unterscheidet es vom Blick ins Ereignisprotokoll?
Server-Monitoring ist ein Verfahren, bei dem ein Werkzeug in festen Abständen Zustandswerte eines Servers abfragt, sie mit Schwellenwerten vergleicht und bei Überschreitung eine Meldung an eine zuständige Person schickt. Drei Bestandteile machen den Unterschied zum manuellen Nachsehen: die Regelmäßigkeit (jede Minute statt einmal im Quartal), die feste Schwelle (ein definierter Wert statt Bauchgefühl) und der Alarmweg (die Meldung kommt zu Ihnen, nicht Sie zu ihr).
Ein Ereignisprotokoll kann das nicht ersetzen. Es sammelt, was passiert ist, meldet aber nichts. Ein Server ohne Monitoring ist deshalb ein Server, dessen Zustand Sie erst kennen, wenn er gestört ist. Ehrlich gesagt unterschätzen das viele Geschäftsführer, weil der Server ja 'läuft'. Er lief in der Szene oben auch, sieben Wochen lang.
Die Server-Überwachung ist ein Teilbereich des umfassenderen IT-Monitorings, das zusätzlich Netzwerkgeräte, Arbeitsplätze und Cloud-Dienste im Blick hat; für Switches, Router und Firewalls beschreibt der Beitrag zum Netzwerk-Monitoring die eigene Logik. Läuft Ihr Server virtualisiert, etwa auf einem Proxmox-Host, gehören Host und jede virtuelle Maschine getrennt ins Monitoring. Ein gesunder Host sagt nichts über die volle Platte in der Buchhaltungs-VM.
Was gehört zur Serverraum-Überwachung und zum Rack-Monitoring?
Serverraum-Überwachung ist die Erfassung der Umgebungsbedingungen, unter denen ein Server arbeitet: Raumtemperatur, Luftfeuchte, Stromversorgung samt USV und Zutritt. Rack-Monitoring bringt dieselben Messungen mit Sensoren und Türkontakten direkt in den Serverschrank. Beides ergänzt die Werte aus dem Server um das, was er selbst nicht sehen kann: Die CPU meldet 78 Grad, aber nicht, dass die Klimaanlage seit Freitag aus ist.
Übliche Empfehlungen für IT-Hardware liegen bei 18-27 Grad Zulufttemperatur und 20-80 Prozent Luftfeuchte ohne Kondensation. Wer schon einmal an einem Sommerwochenende einen Serverraum mit 34 Grad betreten hat, weiß, warum ein Temperatursensor der wirtschaftlichste Teil des ganzen Monitorings ist.
Bei der Stromversorgung zählen drei Fragen: Läuft die USV auf Batterie? Wie lange reicht die Restlaufzeit? Wie alt ist der Akku? USV-Batterien verlieren nach 3-5 Jahren spürbar Kapazität; viele Geräte melden das per SNMP, aber nur, wenn jemand die Meldung abholt.
Beim Zutritt geht es um Türkontakte an Raum und Rack plus Zutrittsprotokoll; das BSI führt den physischen Schutz von Serverräumen als eigenen Baustein (Quelle: BSI IT-Grundschutz-Kompendium, Baustein INF.2). Eine Kameraüberwachung betrifft Mitarbeiter und braucht eine datenschutzrechtliche Grundlage; binden Sie den Datenschutzbeauftragten ein, bevor die Kamera hängt.
Hersteller-Tool, Monitoring-Plattform oder Appliance: Welche Lösung passt?
Für die Server-Überwachung gibt es vier Wege, die sich nicht ausschließen. Die Achse ist weniger das Budget als die Frage, wer die Lösung pflegt und wer auf Meldungen reagiert.
| Ansatz | Was er abdeckt | Stärken | Grenzen | Passt für |
|---|---|---|---|---|
| Hersteller-Tool (Dell iDRAC, HPE iLO) | Hardware des jeweiligen Servers: Laufwerke, RAID, Temperatur, Lüfter, Netzteile, Firmware | Ab Werk dabei, tiefe Hardware-Sicht, funktioniert auch bei abgestürztem Betriebssystem | Sieht nur den eigenen Server, keine Dienste, Backups oder Zertifikate; Alarme je Gerät einzurichten | Als Datenquelle für jede andere Lösung; allein nur bei ein bis zwei Servern |
| Monitoring-Plattform (PRTG, Zabbix, Checkmk, Nagios) | Server, Dienste, Netzwerk, Anwendungen, Umgebungssensoren; frei erweiterbar | Große Abdeckung, feine Schwellen, historische Auswertungen | Braucht Einrichtung und laufende Pflege durch jemanden, der die Plattform beherrscht | Unternehmen mit eigener IT oder betreuendem Systemhaus, ab etwa 10-20 Systemen |
| Appliance/Managed (dwatcher, ein Datadiorama-Produkt) | Fester Prüfumfang: SMART, RAID, Speicher, Firmware, Erreichbarkeit, Temperaturen, Backup-Ziele, Zertifikate, Login-Anomalien | Agentenlos, Klartext-Berichte per E-Mail, keine Plattformpflege durch den Kunden | Fester Prüfumfang statt freier Erweiterbarkeit; ausgelegt auf bis etwa 10 Geräte je Standort | Unternehmen ohne eigene IT-Abteilung, kleine Systemhäuser mit vielen kleinen Standorten |
| Manuelle Sichtkontrolle | Was die Person gerade prüft: Ereignisprotokoll, RAID-Konsole, Backup-Bericht | Keine Kosten für Werkzeuge, kein Einrichtungsaufwand | Nur so gut wie die Disziplin; entfällt bei Urlaub und Personalwechsel | Überbrückung, bis ein Monitoring steht; kein Dauerzustand |
Die Hersteller-Tools sind kein Gegenmodell, sondern die Quelle: iDRAC und iLO liefern die SMART- und RAID-Daten, die eine Plattform oder Appliance einsammelt und bewertet. Wer sie nicht freischaltet, verschenkt die beste Hardware-Sicht, die es gibt. PRTG, Zabbix, Checkmk und Nagios unterscheiden sich in Lizenzmodell und Bedienung, aber nicht in der Grundfrage, ob ein kleiner Betrieb sie selbst pflegen kann; welche Plattform zu welcher Größe passt, behandelt der Monitoring-Tools-Vergleich. Der Appliance-Weg nimmt diese Pflege ab, gegen einen festen Prüfumfang. Welche Werte eine solche Box abfragt, ist bei dwatcher dokumentiert; gleichen Sie das vorab mit Ihrer Tabelle aus dem ersten Abschnitt ab. Fehlt ein Wert, den Sie brauchen, ist die Plattform der bessere Weg.
Wie führen Sie Server-Monitoring in einem kleinen Serverraum ein?
Die Einführung dauert bei bis zu zehn Systemen in der Regel 2-4 Wochen; die reine Technik macht davon nur wenige Stunden aus, der Rest ist Abstimmung über Schwellen und Zuständigkeiten. Der Ablauf in sechs Schritten:
- Bestandsaufnahme: Alle Server, Virtualisierungs-Hosts, virtuellen Maschinen, NAS-Systeme, USV-Geräte und vorhandenen Rack-Sensoren auflisten, dazu Verantwortliche und Wartungsfenster je System notieren.
- Messwerte und Schwellen festlegen: Die zehn Werte aus der Tabelle jedem System zuordnen und die Beispielschwellen an Hardware, Auslastung und Sicherungsrhythmus anpassen.
- Werkzeug auswählen und anbinden: Hersteller-Schnittstellen wie iDRAC, iLO, IPMI und SNMP freischalten, die Plattform oder Appliance einrichten und je System einen Testalarm auslösen.
- Alarmwege und Zuständigkeiten definieren: Festlegen, wer welche Meldung per E-Mail oder Ticket erhält, wer vertritt und nach welcher Zeit ohne Reaktion eskaliert wird, etwa nach 30-60 Minuten bei kritischen Meldungen.
- Probelauf über 2-4 Wochen: Fehlalarme auswerten, Schwellen nachjustieren, Meldungen ohne Handlungsbedarf abschalten und Wartungsfenster als Ausnahmen hinterlegen.
- Regelbetrieb mit Prüfroutine: Einen monatlichen Statusbericht einführen, die Schwellen quartalsweise prüfen und Meldungen samt Reaktion für Cyberversicherung und Nachweispflichten dokumentieren.
Für wen lohnt sich Server-Monitoring und wo liegen die Grenzen?
Server-Monitoring lohnt sich für jedes Unternehmen, das mindestens einen Server betreibt, dessen Ausfall länger als einen halben Arbeitstag kostet. Das trifft auf die Buchhaltung mit dem ERP-Server genauso zu wie auf das Systemhaus, das zwanzig solcher Kunden betreut. Die Grenze nach unten ist ehrlich gezogen: Wer keine eigenen Server mehr hat, weil alles in Microsoft 365 oder einer anderen Cloud läuft, braucht kein Server-Monitoring, sondern eines für Cloud-Konten und Internetanbindung.
Jetzt zu den Grenzen, die im Verkaufsgespräch gern unter den Tisch fallen. Monitoring meldet, es repariert nicht. Eine Warnung um 3 Uhr nachts, die um 9 Uhr gelesen wird, hat sechs Stunden verschenkt. Der zweite Fallstrick ist die Alarmmüdigkeit: Wer täglich zwanzig Meldungen ohne Handlungsbedarf bekommt, liest die einundzwanzigste nicht mehr, und genau die war die SMART-Warnung. Deshalb ist der Probelauf kein Beiwerk. Und Monitoring sieht nur, was gemessen wird; gegen Ransomware hilft ein geprüftes Backup, nicht nur ein überwachtes Backup-Ziel.
Zu den Kosten: Die Spanne reicht von einigen hundert Euro einmalig für Sensoren und eine selbst gepflegte Open-Source-Plattform bis zu einem monatlichen Betrag je System bei Managed-Angeboten, abhängig von Systemzahl, Prüfumfang und davon, ob die Reaktion auf Meldungen enthalten ist. Pauschal lässt sich das nicht sagen, jede Umgebung ist anders gewachsen; was passt, zeigt erst die Bestandsaufnahme.
Wenn Sie klären möchten, welche Werte in Ihrer Umgebung tatsächlich überwacht werden und welche nicht, können Sie ein unverbindliches Erstgespräch mit Datadiorama vereinbaren.
Häufige Fragen
Wie oft sollte ein Server-Monitoring die Werte abfragen?
Reicht das Hersteller-Tool wie iDRAC oder iLO als Server-Monitoring aus?
Was ist der Unterschied zwischen Server-Monitoring und Serverraum-Überwachung?
Was bedeutet Rack-Monitoring konkret?
Kann Server-Monitoring einen Ausfall verhindern?
Passende Leistungen
Verfasst von
Maximilian DalichowIT-Projektleitung