IT-Infrastruktur
Server-Redundanz: Warum zwei Server noch keine Ausfallsicherheit bedeuten
Sind zwei Server automatisch ausfallsicher?
Im Serverschrank stehen zwei physische Server, auf denen mehrere virtuelle Systeme betrieben werden. Damit scheint die wichtigste Voraussetzung für Ausfallsicherheit zunächst erfüllt zu sein: Fällt ein Gerät aus, gibt es schließlich noch das zweite.
Bei genauerer Betrachtung greifen beide Server allerdings auf dasselbe zentrale Speichersystem zu, hängen am gleichen Switch und werden über dieselbe Stromversorgung betrieben. Fällt eine dieser gemeinsam genutzten Komponenten aus, stehen trotz der zwei Server sämtliche Systeme still.
Genau darin liegt einer der häufigsten Denkfehler bei Redundanz. Die Anzahl vorhandener Geräte sagt wenig darüber aus, wie unabhängig sie tatsächlich voneinander arbeiten.
Echte Ausfallsicherheit entsteht erst dann, wenn die komplette Kette betrachtet wird und ein einzelner Fehler nicht weiterhin alle vorgesehenen Ersatzsysteme gleichzeitig trifft.
Zwei Server lösen zunächst nur den Ausfall eines Servers
Wenn virtuelle Maschinen auf zwei physischen Hosts betrieben werden können, lässt sich der Defekt eines einzelnen Servers tatsächlich deutlich besser abfangen als bei einer Umgebung mit nur einem Gerät.
Je nach technischer Lösung können virtuelle Systeme automatisch oder manuell auf dem verbleibenden Host gestartet werden. Damit verkürzt sich die Ausfallzeit erheblich, insbesondere wenn nicht zunächst Ersatzhardware beschafft und ein kompletter Server aus einer Sicherung wiederhergestellt werden muss.
Diese Redundanz schützt allerdings zunächst nur vor bestimmten Hardwarefehlern des Servers selbst.
Wenn beide Hosts dieselben anderen Komponenten benötigen, bleiben diese weiterhin Single Points of Failure.
Deshalb sollte bei einer redundanten Serverumgebung immer gefragt werden, welche gemeinsamen Abhängigkeiten bestehen und ob deren Ausfall ebenfalls berücksichtigt wurde.
Gemeinsamer Speicher kann der eigentliche kritische Punkt sein
Viele virtualisierte Umgebungen verwenden ein zentrales Speichersystem, auf dem die virtuellen Festplatten mehrerer Server liegen.
Das hat technische Vorteile, weil virtuelle Maschinen dadurch leichter zwischen den Hosts verschoben oder auf einem anderen Server gestartet werden können.
Gleichzeitig entsteht eine erhebliche Abhängigkeit vom gemeinsamen Speicher.
Sind beide Server vollständig funktionsfähig, das zentrale SAN oder NAS aber ausgefallen, können die virtuellen Maschinen trotzdem nicht arbeiten.
Ein solches Speichersystem muss deshalb selbst entsprechend der gewünschten Verfügbarkeit ausgelegt sein. Das kann interne Redundanz bei Festplatten, Netzteilen und Netzwerkverbindungen umfassen, löst allerdings weiterhin nicht jedes denkbare Ausfallszenario.
Je höher die Anforderungen an die Verfügbarkeit werden, desto stärker muss deshalb auch der gemeinsame Speicher betrachtet werden.
Alternativ existieren Architekturen, bei denen Speicher über mehrere Server verteilt und repliziert wird, wodurch wiederum andere technische und wirtschaftliche Anforderungen entstehen.
Für die Geschäftsführung ist weniger wichtig, welches konkrete Verfahren eingesetzt wird. Relevant ist die Frage, ob der zweite Server seine Aufgabe auch dann erfüllen kann, wenn andere zentrale Komponenten ausfallen.
Netzwerkredundanz gehört zur Serverredundanz dazu
Ein ähnliches Problem entsteht beim Netzwerk.
Zwei Server können jeweils mehrere Netzwerkanschlüsse besitzen und trotzdem vollständig von einem einzigen zentralen Switch abhängen.
Fällt dieser Switch aus, sind beide Server möglicherweise gleichzeitig nicht mehr erreichbar.
Je nach gewünschter Ausfallsicherheit können deshalb mehrere Netzwerkverbindungen und getrennte Switches verwendet werden. Wichtig ist dabei, die Verbindungen so aufzubauen, dass der Ausfall eines Geräts nicht sämtliche Pfade gleichzeitig unterbricht.
Das gleiche Prinzip gilt für die Verbindung zum Speichersystem.
Eine doppelte Netzwerkkarte im Server verbessert nur dann die Verfügbarkeit, wenn die beiden Kabel nicht unmittelbar danach wieder auf derselben einzelnen Netzwerkkomponente zusammenlaufen.
Gerade hier zeigt sich, warum Managed Switches in zentralen Bereichen mehr sind als bloße Verteiler für Netzwerkanschlüsse. Sie werden selbst Teil der Verfügbarkeitsarchitektur und müssen entsprechend geplant, dokumentiert und gegebenenfalls redundant ausgelegt werden.
Stromversorgung kann alle Server gleichzeitig treffen
Auch eine technisch durchdachte Server- und Netzwerkstruktur bleibt wirkungslos, wenn sämtliche Komponenten an derselben Stromversorgung hängen.
Zwei Server, zwei Switches und ein redundantes Speichersystem können gleichzeitig ausfallen, wenn sie an einer einzigen Steckdosenleiste oder derselben USV betrieben werden und genau diese Komponente einen Defekt erleidet.
Deshalb sollte die Stromversorgung genauso als Teil der gesamten Kette betrachtet werden.
Bei hohen Verfügbarkeitsanforderungen können getrennte Strompfade sinnvoll sein, während kleinere Unternehmen möglicherweise mit einer robusten USV-Lösung und einem klaren Wiederanlaufplan ausreichend abgesichert sind.
Auch hier gilt, dass maximale Redundanz nicht automatisch wirtschaftlich sinnvoll ist. Entscheidend ist, welchen Ausfall das Unternehmen tatsächlich verhindern muss und welche Unterbrechungszeit akzeptabel bleibt.
Hochverfügbarkeit und Backup lösen unterschiedliche Probleme
Eine redundante Serverumgebung kann dafür sorgen, dass Anwendungen trotz eines Hardwaredefekts schnell weiterlaufen. Sie schützt allerdings nicht vor sämtlichen Formen des Datenverlusts.
Wird eine Datei versehentlich gelöscht, eine Datenbank beschädigt oder werden Daten durch Schadsoftware verschlüsselt, kann die Änderung genauso zuverlässig auf redundante Systeme repliziert werden.
Deshalb ersetzt Hochverfügbarkeit keine Datensicherung.
Redundanz und Backup erfüllen unterschiedliche Aufgaben: Redundanz soll den laufenden Betrieb beim Ausfall einer Komponente möglichst aufrechterhalten, während das Backup frühere Daten- oder Systemstände für eine Wiederherstellung bereitstellt.
Eine wirklich belastbare Infrastruktur benötigt deshalb häufig beide Konzepte, allerdings jeweils in dem Umfang, den die geschäftlichen Anforderungen rechtfertigen.
Automatisches Failover ist nicht zwingend notwendig
Beim Begriff Hochverfügbarkeit entsteht schnell das Bild einer Umgebung, in der ein Server ausfällt und sämtliche Anwendungen innerhalb weniger Sekunden automatisch und vollkommen unbemerkt auf einem anderen Gerät weiterlaufen.
Solche Lösungen existieren, erhöhen aber die technische Komplexität und den Aufwand erheblich.
Für viele kleinere Unternehmen reicht es vollkommen aus, wenn ein Techniker nach einem Hardwaredefekt virtuelle Maschinen innerhalb von dreißig oder sechzig Minuten auf einem zweiten Server starten kann.
Das Unternehmen besitzt dann keine unterbrechungsfreie Hochverfügbarkeit, hat aber trotzdem einen sehr schnellen Wiederanlauf im Vergleich zur vollständigen Wiederherstellung auf neuer Hardware.
Dieser Unterschied ist wirtschaftlich wichtig.
Wenn ein Produktionsbetrieb maximal wenige Minuten Stillstand tolerieren kann, kann automatisches Failover notwendig sein. Wenn ein Büro auch eine Stunde überbrücken kann, wäre dieselbe technische Komplexität möglicherweise unnötig.
Die passende Lösung entsteht deshalb aus der erlaubten Ausfallzeit und nicht aus dem Wunsch, technisch möglichst viel zu automatisieren.
Der zweite Server muss genug Leistung für den Notbetrieb haben
Eine weitere Frage betrifft die Kapazität.
Wenn im Normalbetrieb zwei Server jeweils zu siebzig Prozent ausgelastet sind, kann möglicherweise keiner von beiden im Fehlerfall zusätzlich sämtliche Systeme des ausgefallenen Partners übernehmen.
Dann existieren zwar zwei Server, aber keine ausreichende Leistungsreserve für den vorgesehenen Notbetrieb.
Bei einer redundanten Umgebung muss deshalb berücksichtigt werden, welche Last auf dem verbleibenden System entsteht, wenn ein Host vollständig ausfällt.
Dabei muss nicht zwangsläufig jede Anwendung mit voller normaler Leistung weiterarbeiten.
Vielleicht können weniger wichtige virtuelle Systeme im Notfall zunächst ausgeschaltet bleiben, damit Produktion, Warenwirtschaft und zentrale Dienste genügend Ressourcen erhalten.
Diese Priorisierung sollte zur festgelegten Wiederanlaufreihenfolge passen und bereits vor einem Ausfall bekannt sein.
Wartung ist ein oft unterschätzter Vorteil von Redundanz
Eine zweite Serverplattform schützt nicht nur vor ungeplanten Defekten.
Sie kann außerdem geplante Wartungsarbeiten deutlich erleichtern.
Virtuelle Maschinen lassen sich beispielsweise auf den anderen Host verschieben oder dort temporär betreiben, während ein Server aktualisiert, repariert oder neu gestartet wird.
Dadurch sinkt die Hemmschwelle, notwendige Wartungsarbeiten durchzuführen, weil nicht jede Änderung automatisch eine größere Betriebsunterbrechung verursacht.
Gerade bei Unternehmen, die Server nur außerhalb der Arbeitszeit warten können, kann dieser Vorteil praktisch sehr wertvoll sein.
Die zusätzliche Hardware dient damit nicht ausschließlich seltenen Katastrophenfällen, sondern verbessert auch den normalen Betrieb.
Redundanz erhöht gleichzeitig die technische Komplexität
Mehr Server, zusätzliche Netzwerkpfade und replizierter Speicher schaffen neue Möglichkeiten, bringen aber auch zusätzliche Konfiguration und Wartung mit sich.
Eine komplexe Hochverfügbarkeitslösung, die niemand mehr vollständig versteht, kann dadurch selbst zum Risiko werden.
Softwarestände müssen zusammenpassen, Clusterzustände überwacht und Failover-Mechanismen regelmäßig geprüft werden. Wird jahrelang davon ausgegangen, dass der zweite Server automatisch übernimmt, ohne dies jemals zu testen, kann die Überraschung beim tatsächlichen Ausfall groß sein.
Deshalb sollte Redundanz genauso praktisch überprüft werden wie eine Datensicherung.
Ein kontrollierter Test kann zeigen, was passiert, wenn ein Server abgeschaltet wird, welche Systeme tatsächlich automatisch oder manuell übernehmen und ob die verbleibende Leistung ausreicht.
Eine regelmäßige Prüfung der IT-Infrastruktur sollte auch solche Redundanzmechanismen einbeziehen.
Für kleine Unternehmen kann eine einfache Lösung besser sein
Nicht jedes Unternehmen braucht einen Cluster, mehrere Speichersysteme und vollständig doppelte Netzwerkpfade.
Wenn ein Server selten ausfällt, Ersatzhardware kurzfristig verfügbar ist und ein getestetes Backup eine Wiederherstellung innerhalb weniger Stunden ermöglicht, kann diese Lösung für einen kleinen Betrieb wirtschaftlich vollkommen angemessen sein.
Bei anderen Unternehmen verursacht bereits eine Stunde Produktionsstillstand so hohe Kosten, dass zusätzliche Server und redundante Infrastruktur schnell sinnvoll werden.
Eine Priorisierung nach tatsächlichem Geschäftsrisiko hilft dabei, diese Entscheidungen nicht allein aus technischer Sicht zu treffen.
Die richtige Frage lautet deshalb nicht: „Brauchen wir zwei Server?“
Sie lautet: Wie lange darf dieser Dienst ausfallen, welche einzelne Komponente kann ihn heute vollständig stoppen und welche Investition ist gerechtfertigt, um genau diese Ausfallzeit zu reduzieren?
Erst wenn diese Fragen beantwortet sind, lässt sich beurteilen, ob ein zweiter Server wirklich Ausfallsicherheit schafft oder lediglich ein zweites Gerät im gleichen Serverschrank steht.