01515 - 29 00 166
← Zurück zu Wissen

IT-Betrieb

Single Point of Failure in der IT: Wie Unternehmen einzelne Ausfallpunkte erkennen und vermeiden

Von Timo Felderhoff · Veröffentlicht am 25.08.2026 · Aktualisiert am 16.09.2026 · 7 Min. Lesezeit

Was ist ein Single Point of Failure in der IT?

Der zentrale Server besitzt doppelte Netzteile, mehrere Festplatten und wird täglich gesichert. Auf den ersten Blick wirkt die Umgebung damit gut gegen Ausfälle geschützt, trotzdem hängt der komplette Server an einem einzigen Switch, und genau dieser Switch verbindet gleichzeitig die Produktion mit dem restlichen Unternehmensnetz. Fällt er aus, helfen weder das zweite Netzteil noch das RAID des Servers, weil die wichtigsten Systeme schlicht nicht mehr erreichbar sind.

Ein solcher einzelner Ausfallpunkt wird als Single Point of Failure, kurz SPOF, bezeichnet. Gemeint ist eine technische oder organisatorische Komponente, deren Ausfall ausreicht, um einen wichtigen Dienst oder Geschäftsprozess zum Stillstand zu bringen.

Dabei muss es sich keineswegs um den offensichtlich wichtigsten Server handeln. Ein einzelner Switch, eine Firewall, eine Internetleitung, ein Speichersystem, ein bestimmtes Benutzerkonto oder sogar eine Person mit exklusivem Wissen kann genau dieselbe Wirkung haben.

Die entscheidende Frage lautet deshalb nicht, wie viel redundante Technik im Unternehmen vorhanden ist, sondern ob irgendwo eine einzelne Abhängigkeit übrig bleibt, deren Ausfall sämtliche vorgesehenen Sicherheiten wirkungslos macht.

Single Points of Failure verstecken sich häufig außerhalb der Server

Bei der Suche nach Ausfallrisiken konzentriert sich der Blick schnell auf Server und Datenspeicher, weil deren Bedeutung offensichtlich ist. In einer gewachsenen Infrastruktur liegen die überraschenderen Abhängigkeiten jedoch häufig an anderen Stellen.

Mehrere Server können beispielsweise redundant aufgebaut sein und trotzdem über einen einzigen zentralen Switch kommunizieren. Zwei Internetanschlüsse bringen wenig, wenn beide an derselben Firewall enden und für diese weder Ersatzgerät noch aktuelle Konfigurationssicherung vorhanden ist. Eine leistungsfähige Virtualisierungsumgebung kann aus mehreren Servern bestehen und dennoch von einem einzigen gemeinsamen Speichersystem abhängen.

Auch die Stromversorgung gehört dazu. Ein Server mit zwei Netzteilen besitzt nur begrenzte Redundanz, wenn beide an derselben Steckdosenleiste und demselben Stromkreis hängen.

Bei einer Analyse der Abhängigkeit von einzelnen Servern sollte deshalb immer die gesamte Kette betrachtet werden, über die ein Geschäftsprozess funktioniert. Der Server selbst kann hervorragend abgesichert sein, während eine unscheinbare Komponente davor oder dahinter weiterhin den kompletten Dienst lahmlegen kann.

Erst der Geschäftsprozess zeigt, welcher Ausfallpunkt wirklich kritisch ist

Nicht jeder Single Point of Failure muss beseitigt werden.

In praktisch jeder kleinen Unternehmens-IT gibt es einzelne Komponenten, deren Ausfall irgendeine Funktion unterbrechen würde. Würde man jede dieser Abhängigkeiten vollständig redundant aufbauen, könnten die Kosten schnell in keinem vernünftigen Verhältnis zum tatsächlichen Nutzen stehen.

Deshalb muss zuerst betrachtet werden, welche geschäftlichen Folgen der jeweilige Ausfall hätte.

Ein Switch für zwei Büroarbeitsplätze ist technisch ebenfalls ein einzelner Ausfallpunkt, lässt sich aber vielleicht innerhalb einer halben Stunde ersetzen. Ein anderer Switch kann dagegen die komplette Produktionshalle anbinden und dadurch schon nach wenigen Minuten erhebliche Auswirkungen verursachen.

Dasselbe gilt für Server, Internetanschlüsse oder Datenspeicher.

Entscheidend sind deshalb Fragen wie: Welche Mitarbeiter oder Maschinen wären betroffen, wie lange darf die Funktion ausfallen, wie schnell lässt sich Ersatz bereitstellen und welche Übergangslösung existiert?

Erst daraus ergibt sich, ob technische Redundanz notwendig ist oder ein gut vorbereiteter Wiederherstellungsweg vollkommen ausreicht.

Redundanz funktioniert nur, wenn die Ersatzkomponente wirklich unabhängig ist

Eine häufige Reaktion auf einen Single Point of Failure besteht darin, die betreffende Komponente doppelt vorzusehen. Das ist grundsätzlich sinnvoll, funktioniert aber nur dann zuverlässig, wenn nicht beide Systeme weiterhin dieselbe versteckte Abhängigkeit besitzen.

Zwei Server im gleichen Rack können beispielsweise vor einem einzelnen Hardwaredefekt schützen, bleiben bei einem Brand oder größeren Wasserschaden aber gemeinsam gefährdet. Zwei Internetanschlüsse können ausfallen, wenn beide Leitungen über dieselbe Kabeltrasse ins Gebäude gelangen und bei Tiefbauarbeiten gemeinsam beschädigt werden.

Auch bei Datensicherungen gilt dieses Prinzip. Ein zweites NAS direkt neben dem ersten Speichersystem schützt gegen den Defekt eines einzelnen Geräts, aber nicht gegen einen Schaden, der den gesamten Raum betrifft.

Deshalb ist bei Feuer, Wasser und anderen Standortschäden die räumliche Trennung genauso wichtig wie die bloße Anzahl vorhandener Geräte.

Redundanz sollte immer gegen ein konkretes Ausfallszenario geplant werden. Erst dann lässt sich beurteilen, ob die zusätzliche Komponente dieses Risiko tatsächlich unabhängig abdeckt.

Manchmal reicht ein schneller Ersatz statt permanenter Redundanz

Nicht jeder kritische Ausfallpunkt braucht ein zweites dauerhaft laufendes System.

Bei vielen kleinen Unternehmen kann ein vorbereiteter Ersatzweg wirtschaftlich sinnvoller sein.

Ein zentraler Switch lässt sich möglicherweise innerhalb kurzer Zeit gegen ein baugleiches oder vorbereitetes Ersatzgerät austauschen, wenn seine Konfiguration gesichert und passende Hardware verfügbar ist. Eine Firewall kann ebenfalls schnell ersetzt werden, sofern eine aktuelle Konfigurationssicherung existiert und bekannt ist, welches Ersatzmodell geeignet ist.

Damit entsteht zwar weiterhin eine kurze Unterbrechung, der Ausfall bleibt aber beherrschbar.

Diese Strategie ist besonders interessant, wenn eine vollständige Hochverfügbarkeitslösung deutlich teurer wäre als der Schaden einer überschaubaren Ausfallzeit.

Die Entscheidung zwischen Ersatzhardware und schneller Beschaffung sollte deshalb immer berücksichtigen, wie lange ein Unternehmen auf das jeweilige System verzichten kann.

Redundanz ist kein Selbstzweck. Das eigentliche Ziel ist eine Ausfallzeit, die zum Geschäftsbetrieb passt.

Die Firewall ist ein typischer übersehener Ausfallpunkt

Die Firewall sitzt häufig an einer besonders zentralen Stelle, weil über sie Internetzugang, VPN-Verbindungen und die Kommunikation zwischen unterschiedlichen Netzwerkbereichen laufen.

Fällt dieses eine Gerät vollständig aus, kann dadurch wesentlich mehr betroffen sein als nur der Internetzugang.

Gerade bei einer segmentierten Netzwerkstruktur übernimmt die Firewall häufig zusätzlich das Routing und die Kontrolle zwischen Büro, Produktion, Servern und anderen Bereichen. Ohne sie können dann auch interne Verbindungen ausfallen, obwohl sämtliche Switches und Server weiterhin funktionieren.

Deshalb sollte zumindest bekannt sein, wie eine defekte Firewall ersetzt werden kann.

Dazu gehören eine aktuelle Konfigurationssicherung, administrative Zugangsdaten und ein realistischer Weg zu geeigneter Ersatzhardware. Je nach Bedeutung der Infrastruktur kann auch ein zweites Gerät für automatisches oder manuelles Failover sinnvoll sein.

Welche Lösung wirtschaftlich passt, hängt wiederum davon ab, wie lange der Betrieb einen solchen Ausfall verkraftet.

Auch die Internetleitung kann zum Single Point of Failure werden

Je stärker Unternehmen Cloud-Dienste, VoIP-Telefonie, externe Warenwirtschaft, VPN-Verbindungen oder Fernwartung nutzen, desto wichtiger wird die Internetverbindung für den täglichen Betrieb.

Ein lokaler Server kann vollständig funktionieren und trotzdem für externe Mitarbeiter oder andere Standorte nicht erreichbar sein, wenn die einzige Leitung ausfällt.

Bei einer Produktion können zusätzlich Maschinen, Lieferantensysteme oder andere externe Dienste betroffen sein.

Deshalb sollte geprüft werden, welche Geschäftsprozesse tatsächlich vom Internet abhängen und welche davon auch bei einer Störung weiterlaufen müssen.

Eine Backup-Internetverbindung für den Internetausfall kann beispielsweise über LTE, 5G oder einen zweiten Festnetzanschluss realisiert werden. Entscheidend ist dabei, dass der Ersatzweg tatsächlich unabhängig genug von der Hauptverbindung ist und die wichtigsten Anwendungen damit funktionieren.

Menschen können ebenfalls ein Single Point of Failure sein

Nicht jede kritische Abhängigkeit steckt in Hardware.

Wenn nur ein Mitarbeiter den Administratorzugang kennt, nur ein Techniker weiß, wie eine Produktionsmaschine eingebunden ist oder ausschließlich der bisherige IT-Dienstleister Zugriff auf zentrale Konten besitzt, entsteht ein organisatorischer Single Point of Failure.

Der Ausfall dieser Person kann dann ähnlich schwer wie ein technischer Defekt wirken.

Eine Abhängigkeit von einzelnen Wissensträgern lässt sich durch Dokumentation, Vertretungsregelungen und kontrollierte Notfallzugänge reduzieren.

Dabei ist nicht notwendig, dass mehrere Personen jedes technische Detail kennen. Wichtig ist lediglich, dass das Unternehmen bei Krankheit, Kündigung oder Dienstleisterwechsel handlungsfähig bleibt.

Gerade bei langjährig gewachsenen Infrastrukturen ist dieser organisatorische Teil häufig mindestens genauso wichtig wie die technische Redundanz.

Die Datensicherung ist kein Ersatz für Verfügbarkeit

Ein vorhandenes Backup wird bei Ausfallfragen häufig als universelle Absicherung betrachtet.

Das ist nur teilweise richtig.

Eine Datensicherung sorgt dafür, dass Daten und Systeme aus einem früheren Zustand wiederhergestellt werden können. Sie verhindert aber nicht die Ausfallzeit, die zwischen Defekt und erfolgreicher Wiederherstellung entsteht.

Wenn ein Server ausfällt und innerhalb von acht Stunden aus einem getesteten Backup wiederhergestellt werden kann, ist das für manche Unternehmen völlig ausreichend. Bei einem Produktionssystem, das höchstens dreißig Minuten stillstehen darf, reicht dieselbe Lösung möglicherweise nicht.

Hier ergänzen sich Backup, RAID und Redundanz, erfüllen aber unterschiedliche Aufgaben.

Deshalb sollte für jedes wirklich kritische System bekannt sein, ob der vorhandene Schutz lediglich Datenverlust verhindert oder zusätzlich auch die geforderte Verfügbarkeit sicherstellt.

Single Points of Failure findet man am besten entlang der Geschäftsprozesse

Eine reine technische Suche nach einzelnen Geräten greift deshalb zu kurz.

Hilfreicher ist es, einen wichtigen Geschäftsprozess gedanklich vom Anfang bis zum Ende zu verfolgen.

Welche Systeme braucht die Produktion, um einen Auftrag abzuarbeiten? Welche Netzwerkkomponenten liegen dazwischen? Wo werden Daten gespeichert? Welche Benutzerverwaltung wird benötigt? Ist Internetzugang notwendig? Welche Person besitzt im Notfall die erforderlichen Administrationsrechte?

An jeder Stelle kann die Frage gestellt werden: Was passiert, wenn genau diese eine Komponente oder Person morgen nicht verfügbar ist?

Wenn der gesamte Prozess daran scheitert und weder eine Ersatzkomponente noch ein akzeptabler Wiederherstellungsweg vorhanden ist, wurde ein relevanter Single Point of Failure gefunden.

Eine IT-Infrastrukturanalyse sollte solche Abhängigkeiten sichtbar machen und anschließend nach ihrer tatsächlichen betrieblichen Bedeutung bewerten.

Nicht jeder SPOF muss verschwinden, aber jeder wichtige sollte bekannt sein

Eine vollkommen ausfallsichere IT wäre für die meisten kleinen Unternehmen weder realistisch noch wirtschaftlich.

Es wird immer Geräte, Leitungen oder Dienste geben, deren Ausfall zumindest vorübergehend Auswirkungen hat.

Der Unterschied zwischen einer beherrschbaren und einer problematischen Abhängigkeit liegt deshalb vor allem in der Vorbereitung.

Wenn bekannt ist, was ausfallen kann, welche Folgen daraus entstehen und wie schnell ein Ersatz oder eine Wiederherstellung möglich ist, lässt sich das Risiko bewusst akzeptieren oder gezielt reduzieren.

Problematisch sind vor allem diejenigen Single Points of Failure, die erst in dem Moment entdeckt werden, in dem sie tatsächlich ausfallen.

Für die Geschäftsführung reicht deshalb eine einfache Frage als Ausgangspunkt: Welche einzelne technische Komponente oder Person könnte morgen ausfallen und dadurch einen wesentlichen Teil unseres Unternehmens zum Stillstand bringen?

Die Antworten auf diese Frage zeigen häufig sehr schnell, wo sich eine genauere Betrachtung lohnt.