IT-Monitoring

Festplatte voll oder SMART-Warnung auf dem Server: Was jetzt zu tun ist

Porträt von Maximilian DalichowVon Maximilian DalichowIT-Projektleitung
10 Min. LesezeitStand

Eine SMART-Warnung ist die Selbstdiagnose einer Festplatte oder SSD, die meldet, dass ein Verschleißwert eine kritische Schwelle erreicht hat; die Meldung 'Festplatte voll' bedeutet, dass ein Volume auf dem Server keinen freien Platz mehr für Systemdienste, Datenbanken oder Backups hat. Beides sind keine Störungen, die sich aussitzen lassen, aber auch keine, bei denen Hektik hilft. Die ersten Handgriffe entscheiden darüber, ob am Ende ein Plattentausch im laufenden Betrieb steht oder eine Wiederherstellung aus dem Backup. Dieser Beitrag richtet sich an Unternehmen mit eigenem Server oder NAS, nicht an private Rechner.

Auf einen Blick

  • Bei einer SMART-Warnung ist die Platte noch lesbar, aber nicht mehr vertrauenswürdig: Backup-Stand prüfen und den Austausch planen, statt abzuwarten.
  • Die drei SMART-Attribute, die im Serverbetrieb zählen: Reallocated Sectors (Attribut 5), Current Pending Sectors (197) und die Temperatur (194).
  • Bei einer vollen Systemplatte nicht neu starten: Dienste wie Active Directory, SQL Server oder Exchange können ohne freien Platz nicht sauber hochfahren.
  • Platz schaffen nur an sicheren Stellen: Logs, Temp-Verzeichnisse, Update-Caches, Papierkorb. Niemals Systemdateien, Datenbankdateien oder Backup-Ketten von Hand löschen.
  • Die häufigsten Ursachen für volle Serverplatten sind wachsende Logdateien, Schattenkopien, nicht bereinigte Backup-Ketten und Datenbank-Transaktionsprotokolle.
  • Wer Speicherbelegung und SMART-Werte laufend überwacht, bekommt die Warnung in der Regel Wochen vor dem Ausfall, nicht erst, wenn nichts mehr geht.

Was bedeutet die Meldung, und was sollten Sie jetzt tun?

Zuerst die Einordnung: Eine volle Festplatte und eine SMART-Warnung sind zwei verschiedene Probleme, die sich ähnlich anfühlen. Bei 'Festplatte voll' ist die Hardware in Ordnung, aber Dienste finden keinen Platz mehr zum Schreiben. Bei einer SMART-Warnung ist der Platz meist da, aber die Platte selbst hat begonnen, fehlerhafte Sektoren zu melden. Das eine ist ein Kapazitätsproblem, das andere ein beginnender Hardwaredefekt. Manchmal treten beide zusammen auf, etwa wenn ein NAS mit degradiertem RAID läuft und gleichzeitig die Snapshots das Volume füllen.

Was Sie in den ersten 15 Minuten nicht tun sollten, ist fast wichtiger als das, was Sie tun. Nicht neu starten. Ein Windows Server ohne freien Platz auf dem Systemvolume kann beim Hochfahren an Diensten scheitern, die zum Start Protokoll- oder Auslagerungsdateien schreiben müssen; Active Directory, SQL Server und Exchange Server gehören dazu. Exchange drosselt bei knappem Speicherplatz sogar bewusst den Mailtransport, Microsoft nennt das Back Pressure (Quelle: Microsoft Learn). Bei einer SMART-Warnung kann ein Neustart der Moment sein, in dem eine noch lesbare Platte nicht mehr hochkommt.

Stattdessen: Meldung mit Zeitstempel und Laufwerk festhalten, dann den Backup-Stand prüfen. Wann ist die letzte Sicherung gelaufen, und war sie erfolgreich? Wenn Sie das nicht innerhalb von fünf Minuten beantworten können, ist das jetzt Ihre erste Aufgabe. Erst danach geht es ans Aufräumen, ausschließlich an Stellen, die das System nicht braucht: Logdateien, temporäre Verzeichnisse, Update-Caches, Papierkorb. Keine Systemdateien, keine Datenbankdateien, nichts aus Backup-Ordnern, auch wenn die Dateien groß und alt aussehen. Ehrlich gesagt entstehen die meisten Datenverluste in dieser Lage nicht durch den Defekt, sondern durch hektisches Löschen danach.

Was sind SMART-Werte, und welche Attribute zählen wirklich?

SMART-Werte (Self-Monitoring, Analysis and Reporting Technology) sind Zähler, die die Firmware einer Festplatte oder SSD über Fehler, Verschleiß und Betriebsbedingungen führt und die sich mit Bordmitteln des Betriebssystems auslesen lassen. Jedes Attribut hat einen Rohwert, einen normalisierten Wert und eine Herstellerschwelle. Meldet das System 'SMART-Status: Warnung' oder 'schlecht', hat ein Attribut diese Schwelle unterschritten.

Von den rund 30 Attributen, die eine Platte typischerweise liefert, sind im Serverbetrieb drei entscheidend. Reallocated Sectors Count (Attribut 5) zählt Sektoren, die die Platte wegen Lesefehlern aufgegeben und auf Reserveflächen umgelagert hat. Der Wert sinkt nie wieder. Current Pending Sector Count (Attribut 197) zählt Sektoren, die beim Lesen Probleme machten und noch auf eine Neuprüfung warten; beim nächsten Schreibzugriff werden sie entweder freigegeben oder umgelagert. Dazu kommt die Temperatur (Attribut 194): Dauerhaft hohe Werte verkürzen die Lebensdauer, ein plötzlicher Anstieg deutet oft auf einen ausgefallenen Lüfter hin. Bei Server-SSDs treten an die Stelle der Sektoren die Zähler für verbrauchte Schreibreserve (je nach Hersteller Percentage Used oder Wear Leveling).

Was ist nun ein kritischer Wert? Pauschal lässt sich das nicht sagen, weil die Hersteller ihre Schwellen unterschiedlich setzen und ein Rohwert von 3 bei einem Modell harmlos, bei einem anderen ein Warnsignal ist. Zwei Regeln gelten trotzdem: Ein Reallocated-Wert, der innerhalb von Tagen steigt, ist kein Kandidat für Beobachtung, sondern für den Austausch. Und Pending Sectors auf einer Platte mit Datenbanken oder Backups verlangen ein Backup vor jedem weiteren Eingriff. Studien zu großen Plattenbeständen zeigen, dass Laufwerke mit umgelagerten Sektoren in den folgenden Monaten deutlich häufiger ausfallen als solche ohne.

Und wie lesen Sie die Werte aus? Unter Linux mit smartctl aus dem Paket smartmontools, unter Windows Server per PowerShell mit Get-PhysicalDisk und Get-StorageReliabilityCounter, auf einem Synology NAS im Speicher-Manager unter Laufwerksinformationen. Ein Sonderfall ist Hardware-RAID: Dort sieht das Betriebssystem oft nur das logische Volume, und Sie brauchen das Verwaltungswerkzeug des Controller-Herstellers. Dazu gleich mehr im Ablauf.

Festplatte voll auf dem Server: Schritt für Schritt

Der folgende Ablauf gilt für Windows Server, Linux-Server und NAS-Systeme gleichermaßen; die Werkzeuge unterscheiden sich, die Reihenfolge nicht. Rechnen Sie mit 30-90 Minuten, wenn die Ursache eine der üblichen ist, und mit einem halben Tag, wenn ein Plattentausch mit RAID-Rebuild dazukommt.

  1. Zustand sichern: Fehlermeldung mit Zeitstempel und Laufwerk dokumentieren, nicht neu starten, letzten erfolgreichen Backup-Lauf und dessen Datum prüfen.
  2. Belegung analysieren: Feststellen, welches Volume betroffen ist und welche Ordner in den letzten Tagen gewachsen sind (Windows: TreeSize oder WinDirStat, Linux: du und ncdu, Synology: Speicher-Analysator im DSM).
  3. Sicher Platz schaffen: Logdateien archivieren oder rotieren, Temp-Verzeichnisse und Update-Caches leeren, Papierkorb des Servers oder des NAS-Freigabeordners leeren; keine System-, Datenbank- oder Backup-Dateien anfassen.
  4. SMART-Werte auslesen und RAID-Status prüfen: Attribute 5, 197 und 194 aller Platten notieren, bei RAID den Verbund auf degradierten Zustand kontrollieren und die Controller-Ereignisse einsehen.
  5. Ursache beheben: Schattenkopien-Speicher begrenzen, Aufbewahrung der Backup-Ketten korrigieren, Datenbank-Transaktionsprotokolle über ein Protokoll-Backup verkleinern statt löschen, Postfach-Datenbanken bereinigen.
  6. Backup verifizieren und Platte tauschen: Vor dem Tausch eine Testwiederherstellung einer Datei durchführen, dann die defekte Platte ersetzen und den RAID-Rebuild abwarten, ohne währenddessen weitere Änderungen vorzunehmen.
  7. Dokumentieren und Frühwarnung einrichten: Ursache, Maßnahme und neuen Füllstand festhalten, Schwellen für Speicherbelegung und SMART-Status ins Monitoring aufnehmen.

Welche Ursache steckt dahinter, und was hilft dauerhaft?

Volle Serverplatten haben fast immer eine von fünf Ursachen, und jede davon hat eine Sofortmaßnahme, die sicher ist, und eine dauerhafte Lösung, die den Rückfall verhindert. Die Tabelle ordnet das Symptom, das Sie in der Belegungsanalyse sehen, der wahrscheinlichen Ursache zu.

SymptomWahrscheinliche UrsacheSofortmaßnahmeDauerhafte Lösung
Ordner mit Protokolldateien (Windows: Logs unter System32 oder IIS, Linux: /var/log) wächst um Gigabytes pro WocheFehlende Log-Rotation oder ein Dienst, der im Fehlerfall dauerhaft schreibtAlte Logs archivieren und komprimieren, laufende Datei nicht löschen, sondern rotieren lassenLog-Rotation mit Größen- und Altersgrenze einrichten, Ursache des Dauerfehlers beheben
Belegter Platz übersteigt die Summe der sichtbaren Dateien deutlichSchattenkopien (Volume Shadow Copies) oder NAS-Snapshots mit unbegrenztem SpeicherÄltesten Snapshot löschen und Speicherlimit für Schattenkopien setzen (Windows: vssadmin, Synology: Snapshot Replication)Aufbewahrungsregel für Snapshots festlegen und Speicherplatz dafür reservieren
Backup-Ziel oder Backup-Ordner belegt den Großteil des VolumesBackup-Kette ohne Aufbewahrungslimit, fehlgeschlagene Zusammenführung oder verwaiste VollsicherungenKeine Datei von Hand löschen; Aufbewahrung im Backup-Programm prüfen und Bereinigung dort auslösenAufbewahrungsregel nach dem 3-2-1-Prinzip festlegen, Backup-Monitoring mit Alarm auf fehlgeschlagene Läufe
Datenbankdateien oder Transaktionsprotokolle (SQL Server: .ldf) wachsen stetigVollständiges Wiederherstellungsmodell ohne regelmäßige Protokollsicherung, unbegrenztes AutogrowthProtokoll-Backup fahren und Datei anschließend verkleinern; niemals das Protokoll löschenWartungsplan mit Protokollsicherung, Wachstumsgrenzen und eigenem Volume für Datenbanken
Mailstore oder Postfach-Datenbanken belegen den Platz, Mailfluss stocktFehlende Archivierung, Postfächer ohne Größenlimit, Exchange Back Pressure aktivTransportwarteschlange und freien Platz prüfen, Postfachlimits einführen, große Anhänge auslagernArchivierungsrichtlinie, Postfachgrößen mit Quota, Migration zu Exchange Online prüfen
Belegung normal, aber SMART-Status Warnung oder Volume schreibgeschütztFehlerhafte Sektoren, Platte im RAID ausgefallen oder Verbund degradiertBackup-Stand prüfen, keine Schreiblast erzeugen, Ersatzplatte beschaffenPlatte tauschen, RAID-Rebuild überwachen, SMART-Werte laufend prüfen

Ein Muster fällt in der Tabelle auf: Die dauerhafte Lösung ist in fünf von sechs Fällen keine größere Platte, sondern eine Regel. Wer die Aufbewahrung von Snapshots, Backups und Protokollen nicht begrenzt, füllt auch das nächste Volume. Mehr Kapazität kauft Zeit, sie löst das Problem nicht. Was ein Server darüber hinaus laufend liefern sollte, steht ausführlich im Beitrag zum Server-Monitoring.

Wie erfahren Sie beim nächsten Mal früher davon?

Eine volle Festplatte kündigt sich in der Regel über Wochen an, und eine sterbende Platte über Tage bis Monate. Beides lässt sich messen, wenn jemand hinsieht. Genau dafür ist IT-Monitoring gedacht: Eine Software oder ein Gerät prüft in festen Abständen Speicherbelegung, SMART-Status, RAID-Zustand und Temperaturen und meldet sich, sobald eine Schwelle gerissen wird. Was dazugehört, ordnet der Überblick zum IT-Monitoring für Unternehmen ein.

Welche Schwellen sind sinnvoll? Für die Speicherbelegung hat sich eine Warnung bei 80 Prozent und ein Alarm bei 90 Prozent Füllstand bewährt, bei Datenbank- und Backup-Volumes eher früher, weil sie in Sprüngen wachsen. Für SMART-Werte reicht als Auslöser jede Erhöhung der Attribute 5 und 197, unabhängig vom Absolutwert. Ein degradierter RAID-Verbund gehört sofort gemeldet, nicht erst im Wochenbericht.

Die Werkzeuge reichen von Bordmitteln (smartd unter Linux, Benachrichtigungen im Synology DSM, Aufgabenplanung unter Windows) über Monitoring-Software wie PRTG, Zabbix oder Checkmk bis zu Appliances, die ohne Agent im Netz mitlaufen. Bordmittel kosten nichts, aber jemand muss die Mails lesen und die Schwellen je Gerät pflegen; Monitoring-Software deckt deutlich mehr ab und will eingerichtet und betreut werden. Für Unternehmen ohne eigene IT-Abteilung ist eine Appliance mit festem Prüfumfang oft der pragmatischere Weg; dwatcher etwa prüft SMART-Werte, RAID-Status, Speicherbelegung und Backup-Ziele agentenlos und meldet Abweichungen im Klartext per E-Mail. Welche Lösung passt, hängt an Gerätezahl und verfügbarer Zeit, nicht am Funktionsumfang.

Wann sollten Sie einen Dienstleister holen?

Die Grenze verläuft nicht zwischen Laie und Profi, sondern zwischen Aufräumen und Eingreifen. Logs archivieren, Papierkorb leeren, den Speicher-Analysator laufen lassen, SMART-Werte notieren: Das kann der Kollege, der sich nebenbei um die IT kümmert, mit diesem Beitrag selbst erledigen. Sobald aber eine dieser Situationen eintritt, ist externe Hilfe günstiger als der Versuch: Die Systemplatte eines Domänencontrollers oder Datenbankservers ist voll und der Server verhält sich bereits fehlerhaft. Ein RAID-Verbund ist degradiert und Sie wissen nicht sicher, welche Platte betroffen ist. Der letzte erfolgreiche Backup-Lauf liegt länger als eine Woche zurück oder wurde nie testweise zurückgespielt. Oder zwei Platten desselben Verbunds zeigen SMART-Warnungen.

Warum diese Vorsicht? Ein Rebuild belastet alle verbleibenden Platten über Stunden mit Volllast. Fällt dabei eine zweite Platte aus, ist bei RAID 5 der gesamte Verbund verloren. Ohne verifiziertes Backup wird an diesem Punkt aus einer Störung ein Datenverlust. Wie ein Backup aussieht, das diesen Fall abdeckt, beschreibt der Beitrag zu den drei Stufen des Backup-Zen.

Eine Garantie, dass ein Plattentausch im laufenden Betrieb reibungslos durchgeht, gibt es nicht; das zeigt erst der Blick auf Backup-Stand, RAID-Level und die SMART-Werte der übrigen Platten. Wenn Sie klären möchten, wie das in Ihrer Umgebung aussieht, können Sie ein unverbindliches Erstgespräch mit Datadiorama vereinbaren.

FAQ

Häufige Fragen

Was bedeutet eine SMART-Warnung auf dem Server konkret?
Die Festplatte hat über ihre Selbstdiagnose gemeldet, dass ein Verschleiß- oder Fehlerwert die vom Hersteller festgelegte Schwelle erreicht hat, meist die Zahl umgelagerter oder schwebender Sektoren. Die Platte funktioniert in diesem Moment noch, ist aber nicht mehr vertrauenswürdig. Prüfen Sie den Backup-Stand und planen Sie den Austausch, statt abzuwarten, ob der Wert weiter steigt.
Kann ich den Server bei voller Festplatte einfach neu starten?
Davon raten wir ab, solange nicht wenigstens etwas Platz auf dem Systemvolume frei ist. Dienste wie Active Directory, SQL Server oder Exchange brauchen beim Start freien Speicher für Protokoll- und Auslagerungsdateien und können sonst nicht sauber hochfahren. Schaffen Sie zuerst über Logs, Temp-Verzeichnisse und Papierkorb ein paar Gigabyte Luft, dann ist ein Neustart in der Regel unkritisch.
Wie lese ich SMART-Werte auf Windows Server, Linux und Synology NAS aus?
Unter Windows Server liefert PowerShell mit Get-PhysicalDisk und Get-StorageReliabilityCounter die wichtigsten Zähler, unter Linux das Werkzeug smartctl aus dem Paket smartmontools. Auf einem Synology NAS finden Sie den SMART-Status im Speicher-Manager unter den Laufwerksinformationen und können dort einen erweiterten Test starten. Bei Hardware-RAID zeigt das Betriebssystem oft nur das logische Volume; dann brauchen Sie das Verwaltungswerkzeug des Controller-Herstellers.
Welche SMART-Werte sind kritisch?
Im Serverbetrieb zählen vor allem Reallocated Sectors Count (Attribut 5), Current Pending Sector Count (Attribut 197) und die Temperatur (Attribut 194). Eine feste Zahl, ab der es gefährlich wird, gibt es nicht, weil die Hersteller ihre Schwellen unterschiedlich setzen. Steigt der Wert für umgelagerte Sektoren innerhalb weniger Tage, sollten Sie die Platte tauschen; Pending Sectors auf einer Platte mit Datenbanken oder Backups verlangen ein aktuelles Backup vor jedem weiteren Eingriff.
Schützt mich ein RAID vor dem Ausfall einer Festplatte?
Ein RAID überbrückt den Ausfall einer einzelnen Platte (bei RAID 6 zweier Platten), ohne dass der Betrieb stoppt. Es ersetzt aber kein Backup: Gelöschte oder verschlüsselte Dateien sind auf allen Platten des Verbunds gleichzeitig weg. Kritisch wird es während des Rebuilds nach einem Tausch, weil alle verbleibenden Platten dann über Stunden unter Volllast laufen und ein zweiter Ausfall bei RAID 5 den gesamten Verbund kostet.
Was darf ich bei einer vollen Serverplatte gefahrlos löschen?
Sicher sind archivierte oder rotierte Logdateien, temporäre Verzeichnisse, Update-Caches und der Papierkorb von Server oder NAS-Freigabe. Nicht von Hand anfassen sollten Sie Systemdateien, Datenbank- und Transaktionsprotokolldateien, Schattenkopien und alles in Backup-Ordnern, auch wenn die Dateien groß und alt wirken. Diese Bereiche räumen Sie über das jeweilige Programm auf, etwa über die Aufbewahrungsregel der Backup-Software oder ein Protokoll-Backup der Datenbank.

Verfasst von

Porträt von Maximilian DalichowMaximilian DalichowIT-Projektleitung

Schnelles & störungsfreies Arbeiten – für Sie und Ihr Team, jederzeit

Lassen Sie uns in einem kostenlosen Erstgespräch herausfinden, wie wir Ihre IT sicherer, schneller und effizienter machen.