Eine SMART-Warnung ist die Selbstdiagnose einer Festplatte oder SSD, die meldet, dass ein Verschleißwert eine kritische Schwelle erreicht hat; die Meldung 'Festplatte voll' bedeutet, dass ein Volume auf dem Server keinen freien Platz mehr für Systemdienste, Datenbanken oder Backups hat. Beides sind keine Störungen, die sich aussitzen lassen, aber auch keine, bei denen Hektik hilft. Die ersten Handgriffe entscheiden darüber, ob am Ende ein Plattentausch im laufenden Betrieb steht oder eine Wiederherstellung aus dem Backup. Dieser Beitrag richtet sich an Unternehmen mit eigenem Server oder NAS, nicht an private Rechner.
Auf einen Blick
- Bei einer SMART-Warnung ist die Platte noch lesbar, aber nicht mehr vertrauenswürdig: Backup-Stand prüfen und den Austausch planen, statt abzuwarten.
- Die drei SMART-Attribute, die im Serverbetrieb zählen: Reallocated Sectors (Attribut 5), Current Pending Sectors (197) und die Temperatur (194).
- Bei einer vollen Systemplatte nicht neu starten: Dienste wie Active Directory, SQL Server oder Exchange können ohne freien Platz nicht sauber hochfahren.
- Platz schaffen nur an sicheren Stellen: Logs, Temp-Verzeichnisse, Update-Caches, Papierkorb. Niemals Systemdateien, Datenbankdateien oder Backup-Ketten von Hand löschen.
- Die häufigsten Ursachen für volle Serverplatten sind wachsende Logdateien, Schattenkopien, nicht bereinigte Backup-Ketten und Datenbank-Transaktionsprotokolle.
- Wer Speicherbelegung und SMART-Werte laufend überwacht, bekommt die Warnung in der Regel Wochen vor dem Ausfall, nicht erst, wenn nichts mehr geht.
Was bedeutet die Meldung, und was sollten Sie jetzt tun?
Zuerst die Einordnung: Eine volle Festplatte und eine SMART-Warnung sind zwei verschiedene Probleme, die sich ähnlich anfühlen. Bei 'Festplatte voll' ist die Hardware in Ordnung, aber Dienste finden keinen Platz mehr zum Schreiben. Bei einer SMART-Warnung ist der Platz meist da, aber die Platte selbst hat begonnen, fehlerhafte Sektoren zu melden. Das eine ist ein Kapazitätsproblem, das andere ein beginnender Hardwaredefekt. Manchmal treten beide zusammen auf, etwa wenn ein NAS mit degradiertem RAID läuft und gleichzeitig die Snapshots das Volume füllen.
Was Sie in den ersten 15 Minuten nicht tun sollten, ist fast wichtiger als das, was Sie tun. Nicht neu starten. Ein Windows Server ohne freien Platz auf dem Systemvolume kann beim Hochfahren an Diensten scheitern, die zum Start Protokoll- oder Auslagerungsdateien schreiben müssen; Active Directory, SQL Server und Exchange Server gehören dazu. Exchange drosselt bei knappem Speicherplatz sogar bewusst den Mailtransport, Microsoft nennt das Back Pressure (Quelle: Microsoft Learn). Bei einer SMART-Warnung kann ein Neustart der Moment sein, in dem eine noch lesbare Platte nicht mehr hochkommt.
Stattdessen: Meldung mit Zeitstempel und Laufwerk festhalten, dann den Backup-Stand prüfen. Wann ist die letzte Sicherung gelaufen, und war sie erfolgreich? Wenn Sie das nicht innerhalb von fünf Minuten beantworten können, ist das jetzt Ihre erste Aufgabe. Erst danach geht es ans Aufräumen, ausschließlich an Stellen, die das System nicht braucht: Logdateien, temporäre Verzeichnisse, Update-Caches, Papierkorb. Keine Systemdateien, keine Datenbankdateien, nichts aus Backup-Ordnern, auch wenn die Dateien groß und alt aussehen. Ehrlich gesagt entstehen die meisten Datenverluste in dieser Lage nicht durch den Defekt, sondern durch hektisches Löschen danach.
Was sind SMART-Werte, und welche Attribute zählen wirklich?
SMART-Werte (Self-Monitoring, Analysis and Reporting Technology) sind Zähler, die die Firmware einer Festplatte oder SSD über Fehler, Verschleiß und Betriebsbedingungen führt und die sich mit Bordmitteln des Betriebssystems auslesen lassen. Jedes Attribut hat einen Rohwert, einen normalisierten Wert und eine Herstellerschwelle. Meldet das System 'SMART-Status: Warnung' oder 'schlecht', hat ein Attribut diese Schwelle unterschritten.
Von den rund 30 Attributen, die eine Platte typischerweise liefert, sind im Serverbetrieb drei entscheidend. Reallocated Sectors Count (Attribut 5) zählt Sektoren, die die Platte wegen Lesefehlern aufgegeben und auf Reserveflächen umgelagert hat. Der Wert sinkt nie wieder. Current Pending Sector Count (Attribut 197) zählt Sektoren, die beim Lesen Probleme machten und noch auf eine Neuprüfung warten; beim nächsten Schreibzugriff werden sie entweder freigegeben oder umgelagert. Dazu kommt die Temperatur (Attribut 194): Dauerhaft hohe Werte verkürzen die Lebensdauer, ein plötzlicher Anstieg deutet oft auf einen ausgefallenen Lüfter hin. Bei Server-SSDs treten an die Stelle der Sektoren die Zähler für verbrauchte Schreibreserve (je nach Hersteller Percentage Used oder Wear Leveling).
Was ist nun ein kritischer Wert? Pauschal lässt sich das nicht sagen, weil die Hersteller ihre Schwellen unterschiedlich setzen und ein Rohwert von 3 bei einem Modell harmlos, bei einem anderen ein Warnsignal ist. Zwei Regeln gelten trotzdem: Ein Reallocated-Wert, der innerhalb von Tagen steigt, ist kein Kandidat für Beobachtung, sondern für den Austausch. Und Pending Sectors auf einer Platte mit Datenbanken oder Backups verlangen ein Backup vor jedem weiteren Eingriff. Studien zu großen Plattenbeständen zeigen, dass Laufwerke mit umgelagerten Sektoren in den folgenden Monaten deutlich häufiger ausfallen als solche ohne.
Und wie lesen Sie die Werte aus? Unter Linux mit smartctl aus dem Paket smartmontools, unter Windows Server per PowerShell mit Get-PhysicalDisk und Get-StorageReliabilityCounter, auf einem Synology NAS im Speicher-Manager unter Laufwerksinformationen. Ein Sonderfall ist Hardware-RAID: Dort sieht das Betriebssystem oft nur das logische Volume, und Sie brauchen das Verwaltungswerkzeug des Controller-Herstellers. Dazu gleich mehr im Ablauf.
Festplatte voll auf dem Server: Schritt für Schritt
Der folgende Ablauf gilt für Windows Server, Linux-Server und NAS-Systeme gleichermaßen; die Werkzeuge unterscheiden sich, die Reihenfolge nicht. Rechnen Sie mit 30-90 Minuten, wenn die Ursache eine der üblichen ist, und mit einem halben Tag, wenn ein Plattentausch mit RAID-Rebuild dazukommt.
- Zustand sichern: Fehlermeldung mit Zeitstempel und Laufwerk dokumentieren, nicht neu starten, letzten erfolgreichen Backup-Lauf und dessen Datum prüfen.
- Belegung analysieren: Feststellen, welches Volume betroffen ist und welche Ordner in den letzten Tagen gewachsen sind (Windows: TreeSize oder WinDirStat, Linux: du und ncdu, Synology: Speicher-Analysator im DSM).
- Sicher Platz schaffen: Logdateien archivieren oder rotieren, Temp-Verzeichnisse und Update-Caches leeren, Papierkorb des Servers oder des NAS-Freigabeordners leeren; keine System-, Datenbank- oder Backup-Dateien anfassen.
- SMART-Werte auslesen und RAID-Status prüfen: Attribute 5, 197 und 194 aller Platten notieren, bei RAID den Verbund auf degradierten Zustand kontrollieren und die Controller-Ereignisse einsehen.
- Ursache beheben: Schattenkopien-Speicher begrenzen, Aufbewahrung der Backup-Ketten korrigieren, Datenbank-Transaktionsprotokolle über ein Protokoll-Backup verkleinern statt löschen, Postfach-Datenbanken bereinigen.
- Backup verifizieren und Platte tauschen: Vor dem Tausch eine Testwiederherstellung einer Datei durchführen, dann die defekte Platte ersetzen und den RAID-Rebuild abwarten, ohne währenddessen weitere Änderungen vorzunehmen.
- Dokumentieren und Frühwarnung einrichten: Ursache, Maßnahme und neuen Füllstand festhalten, Schwellen für Speicherbelegung und SMART-Status ins Monitoring aufnehmen.
Welche Ursache steckt dahinter, und was hilft dauerhaft?
Volle Serverplatten haben fast immer eine von fünf Ursachen, und jede davon hat eine Sofortmaßnahme, die sicher ist, und eine dauerhafte Lösung, die den Rückfall verhindert. Die Tabelle ordnet das Symptom, das Sie in der Belegungsanalyse sehen, der wahrscheinlichen Ursache zu.
| Symptom | Wahrscheinliche Ursache | Sofortmaßnahme | Dauerhafte Lösung |
|---|---|---|---|
| Ordner mit Protokolldateien (Windows: Logs unter System32 oder IIS, Linux: /var/log) wächst um Gigabytes pro Woche | Fehlende Log-Rotation oder ein Dienst, der im Fehlerfall dauerhaft schreibt | Alte Logs archivieren und komprimieren, laufende Datei nicht löschen, sondern rotieren lassen | Log-Rotation mit Größen- und Altersgrenze einrichten, Ursache des Dauerfehlers beheben |
| Belegter Platz übersteigt die Summe der sichtbaren Dateien deutlich | Schattenkopien (Volume Shadow Copies) oder NAS-Snapshots mit unbegrenztem Speicher | Ältesten Snapshot löschen und Speicherlimit für Schattenkopien setzen (Windows: vssadmin, Synology: Snapshot Replication) | Aufbewahrungsregel für Snapshots festlegen und Speicherplatz dafür reservieren |
| Backup-Ziel oder Backup-Ordner belegt den Großteil des Volumes | Backup-Kette ohne Aufbewahrungslimit, fehlgeschlagene Zusammenführung oder verwaiste Vollsicherungen | Keine Datei von Hand löschen; Aufbewahrung im Backup-Programm prüfen und Bereinigung dort auslösen | Aufbewahrungsregel nach dem 3-2-1-Prinzip festlegen, Backup-Monitoring mit Alarm auf fehlgeschlagene Läufe |
| Datenbankdateien oder Transaktionsprotokolle (SQL Server: .ldf) wachsen stetig | Vollständiges Wiederherstellungsmodell ohne regelmäßige Protokollsicherung, unbegrenztes Autogrowth | Protokoll-Backup fahren und Datei anschließend verkleinern; niemals das Protokoll löschen | Wartungsplan mit Protokollsicherung, Wachstumsgrenzen und eigenem Volume für Datenbanken |
| Mailstore oder Postfach-Datenbanken belegen den Platz, Mailfluss stockt | Fehlende Archivierung, Postfächer ohne Größenlimit, Exchange Back Pressure aktiv | Transportwarteschlange und freien Platz prüfen, Postfachlimits einführen, große Anhänge auslagern | Archivierungsrichtlinie, Postfachgrößen mit Quota, Migration zu Exchange Online prüfen |
| Belegung normal, aber SMART-Status Warnung oder Volume schreibgeschützt | Fehlerhafte Sektoren, Platte im RAID ausgefallen oder Verbund degradiert | Backup-Stand prüfen, keine Schreiblast erzeugen, Ersatzplatte beschaffen | Platte tauschen, RAID-Rebuild überwachen, SMART-Werte laufend prüfen |
Ein Muster fällt in der Tabelle auf: Die dauerhafte Lösung ist in fünf von sechs Fällen keine größere Platte, sondern eine Regel. Wer die Aufbewahrung von Snapshots, Backups und Protokollen nicht begrenzt, füllt auch das nächste Volume. Mehr Kapazität kauft Zeit, sie löst das Problem nicht. Was ein Server darüber hinaus laufend liefern sollte, steht ausführlich im Beitrag zum Server-Monitoring.
Wie erfahren Sie beim nächsten Mal früher davon?
Eine volle Festplatte kündigt sich in der Regel über Wochen an, und eine sterbende Platte über Tage bis Monate. Beides lässt sich messen, wenn jemand hinsieht. Genau dafür ist IT-Monitoring gedacht: Eine Software oder ein Gerät prüft in festen Abständen Speicherbelegung, SMART-Status, RAID-Zustand und Temperaturen und meldet sich, sobald eine Schwelle gerissen wird. Was dazugehört, ordnet der Überblick zum IT-Monitoring für Unternehmen ein.
Welche Schwellen sind sinnvoll? Für die Speicherbelegung hat sich eine Warnung bei 80 Prozent und ein Alarm bei 90 Prozent Füllstand bewährt, bei Datenbank- und Backup-Volumes eher früher, weil sie in Sprüngen wachsen. Für SMART-Werte reicht als Auslöser jede Erhöhung der Attribute 5 und 197, unabhängig vom Absolutwert. Ein degradierter RAID-Verbund gehört sofort gemeldet, nicht erst im Wochenbericht.
Die Werkzeuge reichen von Bordmitteln (smartd unter Linux, Benachrichtigungen im Synology DSM, Aufgabenplanung unter Windows) über Monitoring-Software wie PRTG, Zabbix oder Checkmk bis zu Appliances, die ohne Agent im Netz mitlaufen. Bordmittel kosten nichts, aber jemand muss die Mails lesen und die Schwellen je Gerät pflegen; Monitoring-Software deckt deutlich mehr ab und will eingerichtet und betreut werden. Für Unternehmen ohne eigene IT-Abteilung ist eine Appliance mit festem Prüfumfang oft der pragmatischere Weg; dwatcher etwa prüft SMART-Werte, RAID-Status, Speicherbelegung und Backup-Ziele agentenlos und meldet Abweichungen im Klartext per E-Mail. Welche Lösung passt, hängt an Gerätezahl und verfügbarer Zeit, nicht am Funktionsumfang.
Wann sollten Sie einen Dienstleister holen?
Die Grenze verläuft nicht zwischen Laie und Profi, sondern zwischen Aufräumen und Eingreifen. Logs archivieren, Papierkorb leeren, den Speicher-Analysator laufen lassen, SMART-Werte notieren: Das kann der Kollege, der sich nebenbei um die IT kümmert, mit diesem Beitrag selbst erledigen. Sobald aber eine dieser Situationen eintritt, ist externe Hilfe günstiger als der Versuch: Die Systemplatte eines Domänencontrollers oder Datenbankservers ist voll und der Server verhält sich bereits fehlerhaft. Ein RAID-Verbund ist degradiert und Sie wissen nicht sicher, welche Platte betroffen ist. Der letzte erfolgreiche Backup-Lauf liegt länger als eine Woche zurück oder wurde nie testweise zurückgespielt. Oder zwei Platten desselben Verbunds zeigen SMART-Warnungen.
Warum diese Vorsicht? Ein Rebuild belastet alle verbleibenden Platten über Stunden mit Volllast. Fällt dabei eine zweite Platte aus, ist bei RAID 5 der gesamte Verbund verloren. Ohne verifiziertes Backup wird an diesem Punkt aus einer Störung ein Datenverlust. Wie ein Backup aussieht, das diesen Fall abdeckt, beschreibt der Beitrag zu den drei Stufen des Backup-Zen.
Eine Garantie, dass ein Plattentausch im laufenden Betrieb reibungslos durchgeht, gibt es nicht; das zeigt erst der Blick auf Backup-Stand, RAID-Level und die SMART-Werte der übrigen Platten. Wenn Sie klären möchten, wie das in Ihrer Umgebung aussieht, können Sie ein unverbindliches Erstgespräch mit Datadiorama vereinbaren.
Häufige Fragen
Was bedeutet eine SMART-Warnung auf dem Server konkret?
Kann ich den Server bei voller Festplatte einfach neu starten?
Wie lese ich SMART-Werte auf Windows Server, Linux und Synology NAS aus?
Welche SMART-Werte sind kritisch?
Schützt mich ein RAID vor dem Ausfall einer Festplatte?
Was darf ich bei einer vollen Serverplatte gefahrlos löschen?
Passende Leistungen
Verfasst von
Maximilian DalichowIT-Projektleitung