IT-Monitoring

Server-Monitoring: Welche Werte Sie überwachen sollten, bevor der Server steht

Porträt von Maximilian DalichowVon Maximilian DalichowIT-Projektleitung
9 Min. LesezeitStand

Server-Monitoring ist die laufende, automatisierte Überwachung von Zustandswerten eines Servers, etwa Festplattengesundheit, RAID-Status, Speicherbelegung, Temperatur und Erreichbarkeit, mit dem Ziel, Störungen zu melden, bevor sie den Betrieb treffen. Der Unterschied zum gelegentlichen Blick ins Ereignisprotokoll: Das Monitoring schaut jede Minute hin, vergleicht mit festen Schwellen und meldet sich von allein. Dieser Beitrag zeigt, welche Werte für einen kleinen Serverraum zählen, wie Serverraum-Überwachung und Rack-Monitoring dazugehören und wie die Einführung in sechs Schritten abläuft.

Auf einen Blick

  • Zehn Messwerte decken den Großteil der vermeidbaren Serverausfälle ab: SMART, RAID-Status, Speicherbelegung, CPU- und RAM-Last, Temperatur, Erreichbarkeit, Dienste, Backup-Ziel, Zertifikate und Firmware-Stand.
  • Beispielhafte Warnschwellen: Speicherbelegung ab 80 Prozent, Zertifikats-Restlaufzeit unter 30 Tagen, Raumtemperatur über 27 Grad, kein neuer Sicherungssatz seit 24-48 Stunden.
  • Serverraum-Überwachung ergänzt den Blick in den Server um Temperatur, Luftfeuchte, Strom und USV sowie Zutritt; Rack-Monitoring bringt die Sensoren direkt in den Schrank.
  • Vier Wege führen zum Ziel: Hersteller-Tools wie iDRAC und iLO, Plattformen wie PRTG oder Checkmk, eine Appliance oder Managed Monitoring, und als Notlösung die manuelle Sichtkontrolle.
  • Die Einführung dauert bei bis zu zehn Systemen in der Regel 2-4 Wochen inklusive Probelauf; der größte Aufwand liegt im Justieren der Schwellen und Zuständigkeiten, nicht in der Technik.
  • Monitoring meldet, es repariert nicht: Ohne eine Person oder einen Dienstleister, der auf Meldungen reagiert, bleibt jede Warnung wirkungslos.

Welche Werte gehören ins Server-Monitoring?

Der Server ist nicht abgestürzt. Er ist langsam gestorben. Die erste Festplatte im RAID meldete seit sieben Wochen einen SMART-Warnstatus, die zweite seit vier. Niemand hat es gesehen, weil niemand hinsah: Das Hersteller-Tool zeigte die gelbe Markierung nur beim Login, und das machte seit dem Weggang des Kollegen niemand mehr. Als die zweite Platte ausfiel, stand das Array. Die Wiederherstellung dauerte zwei Arbeitstage, weil auch das Sicherungsziel seit Wochen voll war. So sieht der Normalfall eines ungeplanten Ausfalls in kleinen Umgebungen aus.

Was hätte gemeldet werden müssen? Die Werte in der folgenden Tabelle. Die Schwellen sind Beispiele und müssen an Hardware, Auslastung und Wartungsfenster Ihrer Umgebung angepasst werden.

MesswertWarnschwelle (Beispiel)Was passiert, wenn niemand hinsieht
SMART-Werte der LaufwerkeErste neu zugewiesene oder schwebende Sektoren, SSD-Restlebensdauer unter 20 ProzentDas Laufwerk fällt Wochen später aus; im RAID ohne Redundanz droht Datenverlust. Details unter Festplatte voll oder SMART-Warnung.
RAID-StatusArray nicht mehr 'Optimal', ein Laufwerk länger als 24 Stunden 'Degraded'Ein zweiter Plattenausfall stoppt das Array; dann hilft nur noch das Backup.
SpeicherbelegungWarnung ab 80 Prozent, kritisch ab 90 ProzentDatenbanken und Mail-Dienste stoppen, Updates schlagen fehl.
CPU- und RAM-LastÜber 85 Prozent länger als 15 Minuten außerhalb von WartungsfensternAnwendungen werden träge, die Ursache bleibt unentdeckt.
Temperatur (CPU, Laufwerke, Gehäuse)CPU über 80 Grad, Laufwerke über 50 Grad, Gehäuse über 35 GradThermische Drosselung, verkürzte Lebensdauer, im Extremfall Notabschaltung.
Erreichbarkeit (Ping, Ports)Drei fehlgeschlagene Prüfungen in Folge im MinutenabstandDer Ausfall wird erst gemeldet, wenn Mitarbeiter nicht mehr arbeiten können.
Dienste und ProzesseDefinierter Dienst nicht 'Running', mehr als drei Neustarts pro StundeMailfluss, Datenbank oder Freigabe stehen still, obwohl der Server läuft.
Backup-ZielKein neuer Sicherungssatz seit 24-48 Stunden, Ziel nicht erreichbar oder über 90 Prozent vollDie Sicherung läuft wochenlang ins Leere. Mehr im Beitrag zum Backup-Monitoring.
ZertifikateRestlaufzeit unter 30 Tagen, erneut bei 14 und 7 TagenBrowser-Warnungen, abgebrochene VPN-Verbindungen, Mail-Verschlüsselung bricht ab.
Firmware- und Patch-StandSicherheitsrelevantes Hersteller-Update länger als 30 Tage offenBekannte Schwachstellen und längst behobene Controller-Fehler bleiben bestehen.

Fällt Ihnen auf, dass CPU-Last erst an vierter Stelle steht? Das ist Absicht. In kleinen Umgebungen sterben Server selten an Überlast, sondern an Speichermedien, vollen Volumes und Sicherungen, die niemand prüft. Dazu gleich mehr.

Was ist Server-Monitoring und was unterscheidet es vom Blick ins Ereignisprotokoll?

Server-Monitoring ist ein Verfahren, bei dem ein Werkzeug in festen Abständen Zustandswerte eines Servers abfragt, sie mit Schwellenwerten vergleicht und bei Überschreitung eine Meldung an eine zuständige Person schickt. Drei Bestandteile machen den Unterschied zum manuellen Nachsehen: die Regelmäßigkeit (jede Minute statt einmal im Quartal), die feste Schwelle (ein definierter Wert statt Bauchgefühl) und der Alarmweg (die Meldung kommt zu Ihnen, nicht Sie zu ihr).

Ein Ereignisprotokoll kann das nicht ersetzen. Es sammelt, was passiert ist, meldet aber nichts. Ein Server ohne Monitoring ist deshalb ein Server, dessen Zustand Sie erst kennen, wenn er gestört ist. Ehrlich gesagt unterschätzen das viele Geschäftsführer, weil der Server ja 'läuft'. Er lief in der Szene oben auch, sieben Wochen lang.

Die Server-Überwachung ist ein Teilbereich des umfassenderen IT-Monitorings, das zusätzlich Netzwerkgeräte, Arbeitsplätze und Cloud-Dienste im Blick hat; für Switches, Router und Firewalls beschreibt der Beitrag zum Netzwerk-Monitoring die eigene Logik. Läuft Ihr Server virtualisiert, etwa auf einem Proxmox-Host, gehören Host und jede virtuelle Maschine getrennt ins Monitoring. Ein gesunder Host sagt nichts über die volle Platte in der Buchhaltungs-VM.

Was gehört zur Serverraum-Überwachung und zum Rack-Monitoring?

Serverraum-Überwachung ist die Erfassung der Umgebungsbedingungen, unter denen ein Server arbeitet: Raumtemperatur, Luftfeuchte, Stromversorgung samt USV und Zutritt. Rack-Monitoring bringt dieselben Messungen mit Sensoren und Türkontakten direkt in den Serverschrank. Beides ergänzt die Werte aus dem Server um das, was er selbst nicht sehen kann: Die CPU meldet 78 Grad, aber nicht, dass die Klimaanlage seit Freitag aus ist.

Übliche Empfehlungen für IT-Hardware liegen bei 18-27 Grad Zulufttemperatur und 20-80 Prozent Luftfeuchte ohne Kondensation. Wer schon einmal an einem Sommerwochenende einen Serverraum mit 34 Grad betreten hat, weiß, warum ein Temperatursensor der wirtschaftlichste Teil des ganzen Monitorings ist.

Bei der Stromversorgung zählen drei Fragen: Läuft die USV auf Batterie? Wie lange reicht die Restlaufzeit? Wie alt ist der Akku? USV-Batterien verlieren nach 3-5 Jahren spürbar Kapazität; viele Geräte melden das per SNMP, aber nur, wenn jemand die Meldung abholt.

Beim Zutritt geht es um Türkontakte an Raum und Rack plus Zutrittsprotokoll; das BSI führt den physischen Schutz von Serverräumen als eigenen Baustein (Quelle: BSI IT-Grundschutz-Kompendium, Baustein INF.2). Eine Kameraüberwachung betrifft Mitarbeiter und braucht eine datenschutzrechtliche Grundlage; binden Sie den Datenschutzbeauftragten ein, bevor die Kamera hängt.

Hersteller-Tool, Monitoring-Plattform oder Appliance: Welche Lösung passt?

Für die Server-Überwachung gibt es vier Wege, die sich nicht ausschließen. Die Achse ist weniger das Budget als die Frage, wer die Lösung pflegt und wer auf Meldungen reagiert.

AnsatzWas er abdecktStärkenGrenzenPasst für
Hersteller-Tool (Dell iDRAC, HPE iLO)Hardware des jeweiligen Servers: Laufwerke, RAID, Temperatur, Lüfter, Netzteile, FirmwareAb Werk dabei, tiefe Hardware-Sicht, funktioniert auch bei abgestürztem BetriebssystemSieht nur den eigenen Server, keine Dienste, Backups oder Zertifikate; Alarme je Gerät einzurichtenAls Datenquelle für jede andere Lösung; allein nur bei ein bis zwei Servern
Monitoring-Plattform (PRTG, Zabbix, Checkmk, Nagios)Server, Dienste, Netzwerk, Anwendungen, Umgebungssensoren; frei erweiterbarGroße Abdeckung, feine Schwellen, historische AuswertungenBraucht Einrichtung und laufende Pflege durch jemanden, der die Plattform beherrschtUnternehmen mit eigener IT oder betreuendem Systemhaus, ab etwa 10-20 Systemen
Appliance/Managed (dwatcher, ein Datadiorama-Produkt)Fester Prüfumfang: SMART, RAID, Speicher, Firmware, Erreichbarkeit, Temperaturen, Backup-Ziele, Zertifikate, Login-AnomalienAgentenlos, Klartext-Berichte per E-Mail, keine Plattformpflege durch den KundenFester Prüfumfang statt freier Erweiterbarkeit; ausgelegt auf bis etwa 10 Geräte je StandortUnternehmen ohne eigene IT-Abteilung, kleine Systemhäuser mit vielen kleinen Standorten
Manuelle SichtkontrolleWas die Person gerade prüft: Ereignisprotokoll, RAID-Konsole, Backup-BerichtKeine Kosten für Werkzeuge, kein EinrichtungsaufwandNur so gut wie die Disziplin; entfällt bei Urlaub und PersonalwechselÜberbrückung, bis ein Monitoring steht; kein Dauerzustand

Die Hersteller-Tools sind kein Gegenmodell, sondern die Quelle: iDRAC und iLO liefern die SMART- und RAID-Daten, die eine Plattform oder Appliance einsammelt und bewertet. Wer sie nicht freischaltet, verschenkt die beste Hardware-Sicht, die es gibt. PRTG, Zabbix, Checkmk und Nagios unterscheiden sich in Lizenzmodell und Bedienung, aber nicht in der Grundfrage, ob ein kleiner Betrieb sie selbst pflegen kann; welche Plattform zu welcher Größe passt, behandelt der Monitoring-Tools-Vergleich. Der Appliance-Weg nimmt diese Pflege ab, gegen einen festen Prüfumfang. Welche Werte eine solche Box abfragt, ist bei dwatcher dokumentiert; gleichen Sie das vorab mit Ihrer Tabelle aus dem ersten Abschnitt ab. Fehlt ein Wert, den Sie brauchen, ist die Plattform der bessere Weg.

Wie führen Sie Server-Monitoring in einem kleinen Serverraum ein?

Die Einführung dauert bei bis zu zehn Systemen in der Regel 2-4 Wochen; die reine Technik macht davon nur wenige Stunden aus, der Rest ist Abstimmung über Schwellen und Zuständigkeiten. Der Ablauf in sechs Schritten:

  1. Bestandsaufnahme: Alle Server, Virtualisierungs-Hosts, virtuellen Maschinen, NAS-Systeme, USV-Geräte und vorhandenen Rack-Sensoren auflisten, dazu Verantwortliche und Wartungsfenster je System notieren.
  2. Messwerte und Schwellen festlegen: Die zehn Werte aus der Tabelle jedem System zuordnen und die Beispielschwellen an Hardware, Auslastung und Sicherungsrhythmus anpassen.
  3. Werkzeug auswählen und anbinden: Hersteller-Schnittstellen wie iDRAC, iLO, IPMI und SNMP freischalten, die Plattform oder Appliance einrichten und je System einen Testalarm auslösen.
  4. Alarmwege und Zuständigkeiten definieren: Festlegen, wer welche Meldung per E-Mail oder Ticket erhält, wer vertritt und nach welcher Zeit ohne Reaktion eskaliert wird, etwa nach 30-60 Minuten bei kritischen Meldungen.
  5. Probelauf über 2-4 Wochen: Fehlalarme auswerten, Schwellen nachjustieren, Meldungen ohne Handlungsbedarf abschalten und Wartungsfenster als Ausnahmen hinterlegen.
  6. Regelbetrieb mit Prüfroutine: Einen monatlichen Statusbericht einführen, die Schwellen quartalsweise prüfen und Meldungen samt Reaktion für Cyberversicherung und Nachweispflichten dokumentieren.

Für wen lohnt sich Server-Monitoring und wo liegen die Grenzen?

Server-Monitoring lohnt sich für jedes Unternehmen, das mindestens einen Server betreibt, dessen Ausfall länger als einen halben Arbeitstag kostet. Das trifft auf die Buchhaltung mit dem ERP-Server genauso zu wie auf das Systemhaus, das zwanzig solcher Kunden betreut. Die Grenze nach unten ist ehrlich gezogen: Wer keine eigenen Server mehr hat, weil alles in Microsoft 365 oder einer anderen Cloud läuft, braucht kein Server-Monitoring, sondern eines für Cloud-Konten und Internetanbindung.

Jetzt zu den Grenzen, die im Verkaufsgespräch gern unter den Tisch fallen. Monitoring meldet, es repariert nicht. Eine Warnung um 3 Uhr nachts, die um 9 Uhr gelesen wird, hat sechs Stunden verschenkt. Der zweite Fallstrick ist die Alarmmüdigkeit: Wer täglich zwanzig Meldungen ohne Handlungsbedarf bekommt, liest die einundzwanzigste nicht mehr, und genau die war die SMART-Warnung. Deshalb ist der Probelauf kein Beiwerk. Und Monitoring sieht nur, was gemessen wird; gegen Ransomware hilft ein geprüftes Backup, nicht nur ein überwachtes Backup-Ziel.

Zu den Kosten: Die Spanne reicht von einigen hundert Euro einmalig für Sensoren und eine selbst gepflegte Open-Source-Plattform bis zu einem monatlichen Betrag je System bei Managed-Angeboten, abhängig von Systemzahl, Prüfumfang und davon, ob die Reaktion auf Meldungen enthalten ist. Pauschal lässt sich das nicht sagen, jede Umgebung ist anders gewachsen; was passt, zeigt erst die Bestandsaufnahme.

Wenn Sie klären möchten, welche Werte in Ihrer Umgebung tatsächlich überwacht werden und welche nicht, können Sie ein unverbindliches Erstgespräch mit Datadiorama vereinbaren.

FAQ

Häufige Fragen

Wie oft sollte ein Server-Monitoring die Werte abfragen?
Für Erreichbarkeit und Dienste hat sich ein Intervall von einer Minute bewährt, für SMART-Werte, RAID-Status und Speicherbelegung reichen 5-15 Minuten, für Firmware-Stände und Zertifikate einmal täglich. Kürzere Intervalle erzeugen mehr Last und mehr Meldungen, ohne dass ein Plattendefekt früher erkennbar wird.
Reicht das Hersteller-Tool wie iDRAC oder iLO als Server-Monitoring aus?
Als Hardware-Sicht ja, als Monitoring nein. iDRAC und iLO liefern genaue Daten zu Laufwerken, RAID, Temperatur und Netzteilen, sehen aber weder Dienste noch Backup-Ziele noch Zertifikate. Bei einem einzelnen Server mit sauber eingerichteten E-Mail-Alarmen kann das genügen; ab zwei bis drei Systemen ist eine Plattform oder Appliance in der Regel verlässlicher.
Was ist der Unterschied zwischen Server-Monitoring und Serverraum-Überwachung?
Server-Monitoring misst Werte im Server: Laufwerke, RAID, Speicher, Last, Dienste. Serverraum-Überwachung misst die Umgebung: Raumtemperatur, Luftfeuchte, Stromversorgung samt USV und Zutritt. Beides gehört zusammen, weil der Server seine CPU-Temperatur kennt, aber nicht die ausgefallene Klimaanlage, die sie verursacht.
Was bedeutet Rack-Monitoring konkret?
Rack-Monitoring bezeichnet Sensoren und Kontakte direkt im Serverschrank: Temperatur oben und unten im Rack, Luftfeuchte, Türkontakt, oft auch eine Steckdosenleiste (PDU), die den Stromverbrauch je Anschluss misst. Sinnvoll ist es, wo mehrere Geräte in einem Schrank stehen und die Raumtemperatur nicht sagt, wie warm es im oberen Drittel ist.
Kann Server-Monitoring einen Ausfall verhindern?
Es kann die Ausfälle verhindern, die sich vorher ankündigen, und das ist nach unserer Erfahrung die Mehrheit: sterbende Festplatten, volle Volumes, degradierte RAID-Verbünde, ablaufende Zertifikate. Einen plötzlichen Netzteildefekt oder einen Brand verhindert kein Monitoring; hier verkürzt es allenfalls die Zeit bis zur Reaktion. Eine Garantie gegen jeden Ausfall gibt es in der IT nicht.

Verfasst von

Porträt von Maximilian DalichowMaximilian DalichowIT-Projektleitung

Schnelles & störungsfreies Arbeiten – für Sie und Ihr Team, jederzeit

Lassen Sie uns in einem kostenlosen Erstgespräch herausfinden, wie wir Ihre IT sicherer, schneller und effizienter machen.