Überwachung ist in den meisten Betrieben vorhanden — nur beantwortet sie oft die falsche Frage. Ein Dienst meldet, dass der Server erreichbar ist, ein zweiter, dass der Speicherplatz reicht, ein dritter, dass die Sicherung durchgelaufen ist. Alle drei Meldungen können grün sein, während seit vier Tagen kein einziger Auftrag mehr von der Warenwirtschaft in das Buchhaltungssystem übertragen wurde. Keine dieser Prüfungen schaut in den Vorgang hinein. Wer eine Schnittstelle betreibt oder betreiben lässt, braucht deshalb eine Überwachung, die den Betrieb kennt und nicht nur die Technik: Sind heute Aufträge angekommen? Passt die Menge zu dem, was die Gegenseite gesendet hat? Ist etwas liegen geblieben, das gestern noch durchlief? Dieser Beitrag beschreibt, wie solche fachlichen Prüfungen aufgebaut werden, wie man Schwellwerte setzt, ohne sich in Fehlalarmen zu verlieren, warum eine Meldung ohne namentlich zuständige Person praktisch wertlos ist und was in den Protokollen stehen muss, damit ein Vorfall Wochen später noch nachvollziehbar ist.
Das Wichtigste in Kürze
- Verfügbarkeitsüberwachung beantwortet nur, ob die Technik erreichbar ist; die teuren Störungen im Mittelstand entstehen dort, wo alle technischen Anzeigen grün bleiben und trotzdem keine Daten mehr zwischen zwei Systemen fließen.
- Eine belastbare Überwachung arbeitet auf vier Ebenen: Erreichbarkeit, Lauf, Fachlichkeit und Wirkung — erst die dritte Ebene stellt die Frage, ob heute tatsächlich Aufträge angekommen sind und ob die Mengen zueinander passen.
- Schwellwerte aus festen Zahlen erzeugen Fehlalarme; brauchbar wird eine Schwelle erst aus drei Teilen: einem Erwartungswert aus der eigenen Historie, einem Toleranzband und einer Mindestdauer, bevor überhaupt gemeldet wird.
- Jede Prüfung braucht eine namentlich zuständige Person, eine Vertretung und eine Frist, nach der die nächste Stufe greift; eine Meldung ohne benannten Empfänger ist keine Überwachung, sondern die Dokumentation eines bereits entstandenen Schadens.
- Protokolle müssen Zeitpunkt, geprüfte Größe, Erwartungswert, tatsächlichen Wert, Bewertung und Empfänger enthalten, mit festgelegter Aufbewahrungsdauer — sonst fehlt bei der Aufarbeitung genau der Zeitraum, um den es geht.
Was Verfügbarkeitsüberwachung nicht beantwortet
Verfügbarkeitsüberwachung prüft, ob ein System antwortet. Sie fragt in kurzen Abständen bei einem Server, einem Dienst oder einer Adresse nach und meldet, wenn keine Antwort kommt. Das ist sinnvoll und gehört zur Grundausstattung jedes Betriebs. Nur beschreibt diese Prüfung den Zustand der Technik, nicht das Ergebnis der Arbeit. Sie kann nicht unterscheiden zwischen einer Übertragung, die zwanzigtausend Positionen bewegt hat, und einer, die nichts bewegt hat — beide Male hat der Server geantwortet.
Die Störungen, die im Mittelstand wirklich Geld kosten, sehen sich in der Regel sehr ähnlich: der abgelaufene Zugangsschlüssel, den niemand erneuert hat. Das zusätzliche Pflichtfeld nach einem Update, wegen dem das Zielsystem jeden zweiten Datensatz zurückweist. Der Filter, der nach einer Sortimentsänderung greift und dadurch eine ganze Artikelgruppe ausschließt. Der Auftragsstatus, der umbenannt wurde und deshalb nicht mehr zur Regel passt. In allen vier Fällen läuft der Server durchgehend, der Dienst ist erreichbar, die Sicherung ist grün. Und trotzdem kommt fachlich nichts mehr an.
Der Unterschied zwischen beiden Arten von Überwachung ist weniger technischer als organisatorischer Natur: Verfügbarkeit definiert die Technik, Fachlichkeit definiert der Fachbereich. Welche Menge an einem Dienstagvormittag normal ist, weiß niemand in der IT — das weiß die Person, die täglich mit den Aufträgen arbeitet. Eine Überwachung, die ohne diese Person entworfen wurde, prüft zwangsläufig nur das, was sich technisch messen lässt.
Ein Nachtlauf, der nichts überträgt
Vier Ebenen: von der Erreichbarkeit zur Wirkung
Es hilft, Überwachung nicht als eine Sache zu verstehen, sondern als vier aufeinander aufbauende Ebenen. Jede Ebene beantwortet eine eigene Frage, jede erkennt eine eigene Art von Störung, und keine ersetzt die andere. Wer eine Ebene weglässt, hat an dieser Stelle eine blinde Stelle — nicht schlimm, solange man sie kennt, gefährlich, wenn man sie für abgedeckt hält.
Der Aufwand steigt von Ebene zu Ebene, der Nutzen für den Betrieb allerdings auch. Die ersten beiden Ebenen liefert die Technik meist mit oder sie lassen sich in wenigen Stunden einrichten. Die dritte und vierte Ebene muss jemand fachlich beschreiben, weil dort betriebliche Erwartungen formuliert werden. Genau deshalb bleiben sie in vielen Häusern aus — nicht wegen der Technik, sondern weil niemand die Erwartung aufschreibt.
Ebene 1: Erreichbarkeit
Antwortet der Server, läuft der Dienst, reicht der Speicherplatz, ist das Zertifikat gültig? Diese Prüfungen laufen im Minutentakt und melden harte Ausfälle. Sie sind schnell eingerichtet und decken den kleineren Teil der tatsächlich auftretenden Störungen ab.
Ebene 2: Lauf
Wurde der geplante Übertragungslauf gestartet, hat er sich innerhalb der üblichen Dauer beendet, gab es abgebrochene Verarbeitungen? Diese Ebene erkennt hängende Prozesse und ausgefallene Zeitsteuerungen — sagt aber nichts darüber, ob Inhalte transportiert wurden.
Ebene 3: Fachlichkeit
Sind heute Aufträge übertragen worden, entspricht die Anzahl der Erwartung, sind Belege auf beiden Seiten mit gleicher Summe vorhanden, liegen Vorgänge ungewöhnlich lange im Fehlerbereich? Hier beginnt die Überwachung, den Betrieb abzubilden statt der Technik.
Ebene 4: Wirkung
Stimmen die Bestände beider Systeme am Tagesende überein, wie viele Vorgänge mussten von Hand nachgearbeitet werden, wie hoch ist der Anteil fehlerhafter Übergaben pro Woche? Diese Ebene bewertet nicht einzelne Läufe, sondern die Qualität der Verbindung über die Zeit.
In den meisten Betrieben, deren Betreuung wir übernehmen, ist Ebene 1 vorhanden, Ebene 2 teilweise, Ebene 3 selten und Ebene 4 fast nie (Projekterfahrung). Dabei ist die vierte Ebene die einzige, aus der sich Entscheidungen ableiten lassen: Sie zeigt, welche Verbindung dauerhaft Nacharbeit erzeugt und wo sich eine Überarbeitung rechnet. Welche Kennzahlen dafür taugen und wie sie regelmäßig entstehen, beschreiben wir unter Kennzahlen und Auswertung.
Die drei Fragen, die eine fachliche Prüfung stellt
Eine fachliche Prüfung ist kein kompliziertes Werkzeug, sondern eine Frage, die täglich automatisch gestellt und beantwortet wird. Drei Fragen reichen für den Anfang aus, und sie lassen sich für praktisch jede Verbindung formulieren, unabhängig davon, welche Systeme beteiligt sind: Ist etwas angekommen? Ist die Menge plausibel? Ist etwas liegen geblieben?
Die erste Frage erkennt den vollständigen Stillstand, die zweite die schleichende Lücke, die dritte den Rückstau. Zusammen decken sie den größten Teil dessen ab, was in der Praxis schiefgeht. Wichtig ist, dass die Prüfung von außerhalb der Schnittstelle erfolgt und die Zahlen aus beiden beteiligten Systemen holt. Eine Komponente, die sich selbst prüft, meldet im Zweifel genau dann nichts, wenn sie ausgefallen ist.
- Anzahl übertragener Vorgänge je Richtung und Tag, verglichen mit der Anzahl im Quellsystem
- Summe der Belegwerte auf beiden Seiten für denselben Zeitraum, verglichen auf den Cent
- Alter des ältesten unbearbeiteten Eintrags in der Warteschlange, gemessen in Stunden
- Anzahl der Datensätze, die das Zielsystem zurückgewiesen hat, mit Angabe des häufigsten Grundes
- Zeitpunkt der letzten erfolgreichen Übertragung je Richtung, unabhängig vom Laufstatus
- Anzahl der Stammdatensätze, die auf einer Seite existieren und auf der anderen fehlen
Diese Prüfungen erzeugen einen kurzen Tagesbericht, der auch dann verschickt wird, wenn alles in Ordnung ist. Das klingt nach unnötiger Post, hat aber einen praktischen Zweck: Ein Bericht, der ausbleibt, ist selbst eine Meldung. Wer nur bei Fehlern benachrichtigt wird, kann nicht unterscheiden zwischen einem ruhigen Tag und einer ausgefallenen Überwachung.
Ein solcher Bericht ist in wenigen Minuten lesbar und braucht keine technische Vorbildung. Genau das ist der Punkt: Die Person, die ihn liest, muss beurteilen können, ob 148 Aufträge an diesem Tag plausibel sind. Diese Beurteilung kann kein Werkzeug übernehmen, und sie ist der Grund, warum fachliche Überwachung im Fachbereich verankert gehört und nicht ausschließlich in der IT.
Schwellwerte: ab wann eine Abweichung eine Störung ist
Sobald die Prüfungen stehen, kommt die schwierigere Frage: Ab wann soll gemeldet werden? Feste Zahlen scheitern regelmäßig. Wer festlegt, dass unter fünfzig Aufträgen am Tag gemeldet wird, bekommt an jedem Samstag, an jedem Brückentag und in jeder Betriebsruhe eine Meldung — und schaltet die Prüfung nach drei Wochen ab. Wer die Schwelle dagegen so tief legt, dass sie nie auslöst, hat eine Prüfung, die nur noch Papier ist.
Brauchbar wird ein Schwellwert aus drei Bestandteilen. Erstens aus einem Erwartungswert, der sich aus der eigenen Historie ergibt, etwa dem Mittelwert desselben Wochentags der vergangenen acht Wochen. Zweitens aus einem Toleranzband um diesen Wert herum, das die normale Schwankung abbildet. Drittens aus einer Mindestdauer: Eine Abweichung wird erst dann zur Störung, wenn sie über eine festgelegte Zeit besteht — bei einer Übertragung im Minutentakt etwa dreißig Minuten, bei einem Nachtlauf ein einzelner ausgefallener Lauf.
| Prüfung | Schwellwert, der trägt | Schwellwert, der Fehlalarme erzeugt |
|---|---|---|
| Anzahl Aufträge pro Tag | Abweichung über das Toleranzband desselben Wochentags aus acht Wochen hinaus | Feste Untergrenze, unabhängig von Wochentag und Saison |
| Belegsummen beider Seiten | Differenz ungleich null, geprüft nach Abschluss des Tageslaufs | Prüfung während des laufenden Abgleichs, wenn Zwischenstände normal sind |
| Alter des ältesten Wartenden | Älter als die vereinbarte Bearbeitungsfrist der Verbindung | Jeder Eintrag, der länger als eine Minute wartet |
| Zurückgewiesene Datensätze | Anteil über dem gewohnten Niveau oder ein neuer, bisher unbekannter Grund | Jede einzelne Zurückweisung als eigene Meldung |
| Zeitpunkt der letzten Übertragung | Länger her als der vereinbarte Takt zuzüglich einer Karenzzeit | Exakt der Takt ohne Karenzzeit, damit jede Verzögerung meldet |
| Stammdaten-Abweichung | Neue Abweichungen gegenüber dem Vortag | Gesamtzahl aller Abweichungen, einschließlich bekannter Altfälle |
Praktisch bewährt hat sich, zunächst breit anzufangen und die Schwellen nach zwei bis vier Wochen nachzuziehen, wenn die tatsächliche Schwankung bekannt ist. Dazu gehört ein Betriebskalender: Feiertage, Betriebsruhe, Inventurtage und angekündigte Wartungsfenster gehören hinterlegt, sonst meldet die Überwachung an genau den Tagen, an denen ohnehin niemand erreichbar ist. Eine Schwelle, die nie ausgelöst hat, ist keine ruhige Verbindung, sondern eine ungeprüfte Annahme.
Eine Meldung ohne Zuständigen ist nur Dokumentation
Der häufigste Grund, warum Überwachung im Mittelstand ins Leere läuft, ist nicht fehlende Technik, sondern fehlende Zuständigkeit. Die Meldung geht an eine Sammeladresse, in der alle mitlesen und deshalb niemand handelt, oder an eine Verteilerliste, die vor drei Jahren angelegt wurde und Personen enthält, die den Betrieb längst verlassen haben. Fachlich ist die Störung erkannt worden — betrieblich ist nichts passiert.
Zuständigkeit heißt: eine namentlich benannte Person, eine namentlich benannte Vertretung, eine Frist für die erste Reaktion und eine zweite Stufe, die greift, wenn diese Frist verstreicht. Das ist keine Bürokratie, sondern die einzige Möglichkeit, aus einer Meldung eine Handlung zu machen. Für die meisten Verbindungen in einem mittelständischen Betrieb genügen drei bis vier Stufen, und sie passen auf eine halbe Seite.
Stufe 1: Meldung an die zuständige Person
Die Meldung geht an die fachlich zuständige Person, mit Betreffzeile, betroffener Verbindung, Zeitpunkt und der Angabe, welcher Wert außerhalb der Erwartung liegt. Die Reaktionsfrist liegt im Tagesgeschäft üblicherweise bei zwei Stunden, bei nächtlichen Läufen beim Vormittag des Folgetages.
Stufe 2: Vertretung und technische Betreuung
Bleibt eine Rückmeldung aus, geht dieselbe Meldung an die Vertretung und an die technische Betreuung. Wichtig ist, dass die Meldung nicht nur wiederholt wird, sondern erkennbar als Eskalation gekennzeichnet ist, einschließlich der bereits verstrichenen Zeit.
Stufe 3: Betriebsleitung informieren
Nach einer festgelegten Gesamtdauer — häufig ein halber Arbeitstag — wird die Leitung informiert, weil ab diesem Punkt betriebliche Entscheidungen anstehen: Wird von Hand erfasst, werden Kunden informiert, wird die Auslieferung angehalten? Diese Entscheidungen gehören nicht in die Technik.
Stufe 4: Entwarnung und kurze Notiz
Nach der Behebung geht eine Entwarnung an alle vorher informierten Stellen, damit niemand doppelt eingreift. Dazu kommen drei Zeilen ins Protokoll: Ursache, Erkennungsweg, Dauer bis zur Meldung. Diese Notiz ist später die Grundlage für die Frage, welche Verbindung Aufmerksamkeit braucht.
Die Meldung geht an die fachlich zuständige Person, mit Betreffzeile, betroffener Verbindung, Zeitpunkt und der Angabe, welcher Wert außerhalb der Erwartung liegt. Die Reaktionsfrist liegt im Tagesgeschäft üblicherweise bei zwei Stunden, bei nächtlichen Läufen beim Vormittag des Folgetages.
Bleibt eine Rückmeldung aus, geht dieselbe Meldung an die Vertretung und an die technische Betreuung. Wichtig ist, dass die Meldung nicht nur wiederholt wird, sondern erkennbar als Eskalation gekennzeichnet ist, einschließlich der bereits verstrichenen Zeit.
Nach einer festgelegten Gesamtdauer — häufig ein halber Arbeitstag — wird die Leitung informiert, weil ab diesem Punkt betriebliche Entscheidungen anstehen: Wird von Hand erfasst, werden Kunden informiert, wird die Auslieferung angehalten? Diese Entscheidungen gehören nicht in die Technik.
Nach der Behebung geht eine Entwarnung an alle vorher informierten Stellen, damit niemand doppelt eingreift. Dazu kommen drei Zeilen ins Protokoll: Ursache, Erkennungsweg, Dauer bis zur Meldung. Diese Notiz ist später die Grundlage für die Frage, welche Verbindung Aufmerksamkeit braucht.
Wird die Betreuung extern vergeben, gehört die Eskalationskette in die Vereinbarung: wer meldet, wer reagiert, innerhalb welcher Zeiten und was außerhalb der Geschäftszeiten gilt. Ohne diese Festlegung entsteht die typische Lücke, in der beide Seiten annehmen, die andere kümmere sich. Wie ein solcher Betreuungsrahmen aufgebaut sein kann, beschreiben wir unter IT-Betrieb.
Eine Überwachung ist so gut wie der Name, der hinter jeder Prüfung steht — nicht so gut wie die Technik, die sie ausführt.
Protokolle: was aufgezeichnet wird und wie lange es bleibt
Protokolle sind der Teil, der bei der Einrichtung am unwichtigsten wirkt und bei der Aufarbeitung eines Vorfalls am meisten fehlt. Die Frage ist nie, ob überhaupt protokolliert wird — irgendetwas schreibt fast jedes System mit. Die Frage ist, ob im Protokoll steht, was man später braucht, und ob es zu diesem Zeitpunkt noch existiert.
Für eine fachliche Prüfung gehören sechs Angaben in jede Zeile: Zeitpunkt, geprüfte Größe, Erwartungswert, tatsächlicher Wert, Bewertung und Empfänger der Meldung. Ohne den Erwartungswert lässt sich später nicht mehr sagen, ob die Prüfung damals überhaupt hätte auslösen müssen. Ohne den Empfänger ist nicht nachvollziehbar, wer informiert war. Beide Angaben werden regelmäßig weggelassen, weil sie im Normalbetrieb überflüssig wirken.
zeitpunkt : 11.06.2026 18:45:03
kennzahl : auftragsanzahl_tag
verbindung : Warenwirtschaft -> Buchhaltungssystem
erwartet : 132 bis 176 (Mittelwert Do, 8 Wochen)
gemessen : 148
bewertung : im Toleranzband
meldung_an : keine Meldung erzeugt
aufbewahrung_bis : 11.06.2027Die zweite Hälfte betrifft die Aufbewahrung. In vielen Umgebungen überschreiben sich Protokolle nach wenigen Tagen, weil die Voreinstellung so gesetzt ist. Fällt ein Fehler erst im Monatsabschluss auf, ist genau der Zeitraum verschwunden, um den es geht. Sinnvoll ist eine ausdrücklich festgelegte Aufbewahrungsdauer je Verbindung, getrennt nach technischem Protokoll und fachlichem Prüfprotokoll — technische Zeilen dürfen kürzer leben, fachliche sollten mindestens einen abgeschlossenen Abschlusszyklus überdauern.
Aufbewahrung und Datenschutz gehören zusammen betrachtet
Wo diese Festlegungen hingehören, ist keine Geschmacksfrage: in die Beschreibung der Verbindung, zusammen mit Richtung, Takt, Zuständigkeit und Wiederanlauf. Eine Überwachung, die nur in Werkzeugen eingestellt und nirgends beschrieben ist, geht mit dem nächsten Systemwechsel verloren. Wie sich solche Beschreibungen knapp halten lassen, ohne zum Aktenordner zu werden, zeigen wir unter Prozessdokumentation.
Fehlalarme kosten mehr als fehlende Alarme
Es gibt einen Zustand, der schlechter ist als keine Überwachung: eine Überwachung, der niemand mehr glaubt. Sie entsteht auf dem gleichen Weg. Anfangs sind die Schwellen zu eng gesetzt, es kommen täglich mehrere Meldungen, von denen die meisten keine Handlung erfordern. Nach zwei Wochen richtet der Empfänger eine Regel ein, die diese Nachrichten in einen Ordner sortiert. Ab diesem Moment ist die Überwachung faktisch abgeschaltet, obwohl in jedem Bericht steht, dass sie aktiv ist.
Gegenmittel gibt es mehrere, und sie kosten wenig. Meldungen zusammenfassen statt einzeln verschicken: eine Nachricht je Verbindung und Vorfall, nicht je fehlgeschlagenem Datensatz. Wiederholungen unterdrücken, solange ein Vorfall offen ist, und stattdessen in festen Abständen erinnern. Bekannte, geplante Zustände stumm schalten, aber nur befristet und mit automatischem Wiedereinschalten — eine dauerhaft stumme Prüfung ist eine gelöschte Prüfung, nur unehrlicher.
Die Kennzahl, die den Zustand der Überwachung zeigt
Der zweite Prüfstein ist der bewusste Test. Eine Überwachung, die nie ausgelöst hat, ist eine Vermutung. Einmal im Quartal wird eine Prüfung absichtlich zum Auslösen gebracht — Zugangsdaten befristet ungültig setzen, den Dienst kurz anhalten, einen Testdatensatz mit falscher Menge einspielen. Gemessen wird nicht nur, ob eine Meldung kommt, sondern wann sie kommt und bei wem sie ankommt. In der Praxis fällt dabei häufiger die Empfängerliste auf als die Technik (Projekterfahrung).
Einführung in überschaubaren Schritten
Der übliche Fehler bei der Einführung ist der Anspruch auf Vollständigkeit. Wer alle Verbindungen gleichzeitig auf vier Ebenen überwachen will, braucht ein Projekt, ein Budget und Abstimmung — und beginnt deshalb nie. Sinnvoller ist die umgekehrte Reihenfolge: mit der Verbindung anfangen, deren dreitägiger Ausfall den größten Rückstand erzeugen würde, und dort die einfachste wirksame Prüfung einrichten.
Die folgende Reihenfolge lässt sich nebenher abarbeiten. Jeder Schritt bringt für sich genommen Nutzen, und man kann nach jedem Schritt aufhören, ohne einen halbfertigen Zustand zu hinterlassen. Der organisatorische Teil überwiegt: Die Punkte eins bis drei sind überwiegend Absprache, erst ab Punkt vier entsteht Umsetzungsaufwand.
- Verbindungen auflisten: Quelle, Ziel, Richtung, Takt, fachlich zuständige Person, technische Betreuung. Ohne diese Liste bleibt jede weitere Maßnahme Stückwerk.
- Zuständigkeit und Frist je Verbindung festlegen, einschließlich Vertretung und der Frage, was außerhalb der Geschäftszeiten gilt.
- Eine fachliche Frage je Verbindung formulieren, in der Sprache des Fachbereichs: Was muss bis wann angekommen sein, damit der Tag normal ist?
- Die einfachste Prüfung dazu einrichten, meist ein Mengenvergleich einmal täglich, und den Bericht auch dann verschicken, wenn der Lauf sauber durchgelaufen ist.
- Schwellwerte nach zwei bis vier Wochen nachziehen, wenn die tatsächliche Schwankung bekannt ist, und den Betriebskalender hinterlegen.
- Protokollinhalt und Aufbewahrungsdauer festlegen und in der Beschreibung der Verbindung vermerken.
- Einmal im Quartal einen Auslösetest fahren und dabei prüfen, ob die Empfängerliste noch stimmt.
Für Betriebe ohne eigene IT-Abteilung ist das trotzdem ein spürbarer Aufwand, vor allem in den Punkten vier und sechs. Er lässt sich als einmalige Einrichtung mit anschließender laufender Betreuung abbilden; die Aufnahme aller Verbindungen mit Richtung, Takt und Zuständigkeit ist Teil einer Prozessanalyse, und wie sich Einrichtung und laufende Betreuung abrechnen, steht unter Preise. Der entscheidende Punkt bleibt unabhängig davon, wer es umsetzt: Überwachung ohne benannte Zuständigkeit ist eine technische Anzeige. Erst mit Name, Frist und Eskalation wird sie ein Teil des Betriebs.
Verwandte Artikel
Wenn eine Schnittstelle ausfällt: stille Störungen erkennen
Stille Schnittstellenausfälle bemerken, melden und überbrücken: Herzschlag, Zeitfenster, Mengenabgleich, Warteschlange und geregelter Wiederanlauf im Betrieb.
Dateiimport automatisieren: sechs Fehlerbilder und Abwehr
Täglicher Dateiimport zwischen zwei Systemen: sechs typische Fehlerbilder von Trennzeichen bis Doppellieferung, und wie man sie prüft, protokolliert und meldet.
Rechnungsprüfung automatisieren: der Drei-Wege-Abgleich
Bestellung, Wareneingang und Rechnung maschinell abgleichen: welche Felder verglichen werden, wo das Toleranzband liegt und wer den Klärfall bekommt.