Zwei überlagerte Fehlerbilder in einem Zeitfenster, ohne gemeinsame Ursache. Getrennt, zugeordnet und der Rollout in zehn Tagen wieder freigegeben.
Symptom
Bei einem Labordienstleister im Gesundheitswesen sollte ein neuer Windows-Client auf 300 Geräte ausgerollt werden. Der Rollout musste gestoppt werden: betroffene Geräte zeigten nach der Anmeldung wiederholt nur noch einen grauen Bildschirm und waren anschließend nicht mehr bedienbar. Der Stopp dauerte sieben Wochen.
Parallel meldeten Anwender spürbare Verzögerungen bei der Dateneingabe. Beide Symptome traten im selben Zeitraum und auf denselben Geräten auf, weshalb intern von einer gemeinsamen Ursache ausgegangen wurde. Genau diese Annahme hat die Fehlersuche blockiert.
Analyse, Teil 1: der graue Bildschirm
Die System-Umgebungsvariable PATH wurde über eine Gruppenrichtlinieneinstellung bei jeder Verarbeitung erweitert. Vorhandene Einträge wurden dabei nicht ersetzt, sondern erneut angehängt. Mit jedem Durchlauf wuchs die Variable weiter, bis sie die zulässige Länge überschritt.
Die Folge: Windows konnte den Pfad zum eigenen Systemverzeichnis nicht mehr auflösen. Prozesse, die beim Anmelden auf diesen Pfad angewiesen sind, starteten nicht mehr, das Gerät blieb nach der Anmeldung ohne Oberfläche.
Der Fehler wurde behoben, indem das Verhalten der Richtlinie umgestellt wurde: auf Ersetzen des Wertes statt Verkettung der Werte.
Analyse, Teil 2: die Verzögerungen
Nach der Korrektur bestanden die Eingabeverzögerungen weiter. Betroffen war eine selbst entwickelte Terminalanwendung, in der große Datenmengen in kurzen, dicht getakteten Arbeitsschritten erfasst werden. Bei einer Verzögerung von rund zwei Sekunden je Eingabe war ein durchgängiges Arbeiten nicht möglich.
Der neue Client stand als Ursache im Raum. Statt den Client-Stack zu verändern, haben wir einen Vergleichstest aufgesetzt: identisches Gerät, identische Konfiguration, identischer Benutzer, ausschließlich das Netzwerksegment getauscht. Im bisherigen Netzwerk arbeitete derselbe Client ohne Verzögerungen.
Damit war der Client als Ursache ausgeschlossen und die Störung eindeutig im neu aufgebauten Netzwerk verortet. Die weitere Eingrenzung führte auf eine Fehlkonfiguration an einem Switch in Verbindung mit einem Verkabelungsfehler. Nach der Behebung der beiden Probleme, arbeitete die Anwendung wieder ohne Verzögerung.
Ergebnis
- 7 Wochen Rolloutstopp beendet
- 300 Clients freigegeben
- 10 Tage von der Beauftragung bis zur Freigabe des Rollouts
Der entscheidende Schritt war nicht die einzelne Korrektur, sondern die Trennung: zwei zeitgleiche Symptome ohne gemeinsame Ursache. Ohne den Vergleichstest wäre absehbar der Client-Stack umgebaut worden, ohne dass dies die Verzögerungen behoben hätte.
Der erste Fehler zeigt daneben ein wiederkehrendes Muster: Konfigurationsmechanismen, die bei jeder Ausführung anhängen statt ersetzen, funktionieren im Test und scheitern im Dauerbetrieb. Reproduzierbarkeit ist deshalb kein Selbstzweck, sondern Voraussetzung für einen kontrollierbaren Rollout.
