Zwei Datensätze für denselben Kunden, drei interne Nummern für dasselbe Bauteil: Dubletten fallen im Alltag lange nicht auf, weil jeder einzelne Satz für sich plausibel aussieht. Sichtbar werden sie erst, wenn eine Rechnung an eine längst aufgegebene Anschrift geht, wenn ein Bestand in der Auswertung doppelt gezählt wird oder wenn zwei Personen im Vertrieb denselben Kunden betreuen, ohne voneinander zu wissen. Dieser Beitrag beschreibt, wie doppelte Kunden- und Artikelsätze entstehen, wie sie sich finden lassen, nämlich über einen Ähnlichkeitsvergleich statt über exakte Übereinstimmung, und wie sich zwei Sätze zusammenführen lassen, ohne die Historie zu verlieren. Er begründet außerdem, warum ein vollautomatischer Abgleich ohne menschliche Prüfung riskant ist, und wie eine Prüfung bei der Neuanlage verhindert, dass der bereinigte Bestand nach einem Jahr wieder aussieht wie vorher. Wer Systeme verbindet, ohne vorher aufzuräumen, verteilt die Dubletten nur schneller: Deshalb gehört dieser Schritt an den Anfang jeder Datenintegration.
Das Wichtigste in Kürze
- Dubletten entstehen nicht durch Unachtsamkeit, sondern durch Systemwechsel, Datenübernahmen, getrennte Erfassungswege und eine Neuanlage, die nicht prüft, ob es den Kunden oder den Artikel bereits gibt.
- Eine Suche nach exakter Übereinstimmung findet fast nichts: Erst die Normalisierung von Adresse, Rechtsform, Telefonnummer und Schreibweise macht zwei scheinbar verschiedene Sätze überhaupt vergleichbar.
- Der Vergleich liefert keinen Ja-Nein-Wert, sondern ein Maß für Ähnlichkeit je Feld; daraus entstehen drei Klassen: sicherer Treffer, Prüffall für Menschen und klarer Nichttreffer.
- Zusammenführen bedeutet nicht löschen: Der unterlegene Satz bleibt als verweisender Eintrag bestehen, damit Belege, Aufträge und gesetzliche Aufbewahrungspflichten unberührt bleiben und jede Zusammenführung nachvollziehbar ist.
- Ein vollautomatischer Abgleich ohne Prüfung ist gefährlich, weil eine falsche Zusammenführung fachlich schwer rückgängig zu machen ist; die dauerhafte Lösung ist die Dublettenprüfung im Moment der Neuanlage.
Wie Dubletten entstehen, und warum das kein Sorgfaltsproblem ist
Die häufigste Ursache ist banal: Eine Person legt einen Kunden neu an, weil sie ihn im Bestand nicht findet. Nicht, weil er fehlt, sondern weil er anders geschrieben ist. Die Suchmaske im System verlangt den Anfang des Namens, gesucht wurde aber nach dem zweiten Wortbestandteil. Die Rechtsform wurde einmal ausgeschrieben und einmal abgekürzt. Der Straßenname steht einmal mit Punkt und einmal ausgeschrieben. In dieser Situation ist die Neuanlage die vernünftige Reaktion, weil der Vorgang weitergehen muss. Der doppelte Satz entsteht also genau dort, wo jemand seine Arbeit erledigt und nicht dort, wo jemand unaufmerksam ist.
Die zweite große Quelle sind Datenübernahmen. Bei jedem Systemwechsel, bei jeder Zusammenführung zweier Bestände und bei jedem Import aus einer Liste treffen Datensätze aufeinander, die dieselbe Wirklichkeit beschreiben, aber unterschiedlich aufgebaut sind. Wenn der Import keine Prüfung enthält, entstehen in wenigen Minuten mehr Dubletten als in Jahren manueller Arbeit. Wer eine Altsystem-Ablösung plant, sollte die Bereinigung deshalb vor die Übernahme legen und nicht danach, denn im Zielsystem sind die Sätze bereits mit neuen Vorgängen verknüpft und damit schwerer zu trennen.
Die dritte Quelle sind getrennte Erfassungswege. Ein Kontaktformular auf der Website legt einen Interessenten an, das Ladengeschäft erfasst denselben Menschen an der Kasse, der Außendienst führt seine eigene Liste. Solange diese Wege nicht auf denselben Bestand schauen, ist die Dublette systembedingt und keine Frage der Disziplin. Bei Artikelsätzen kommt hinzu, dass Einkauf, Lager und Verkauf unterschiedliche Bezeichnungen für dasselbe Teil verwenden, oft aus guten Gründen. Eine Dublette ist selten ein Tippfehler, sondern fast immer das Ergebnis eines Ablaufs ohne Prüfschritt.
Drei Begriffe, die auseinandergehalten werden sollten
Was doppelte Sätze im Betrieb tatsächlich kosten
Der sichtbare Teil der Kosten ist klein: ein paar Minuten Suche, gelegentlich eine Rückfrage. Der teure Teil steckt in den Folgen. Wenn ein Kunde unter zwei Nummern geführt wird, verteilt sich sein Umsatz auf zwei Sätze. Die Auswertung zeigt zwei mittelgroße Kunden statt eines großen, die Rabattstaffel greift nicht, das offene Posten-Bild stimmt nicht, und eine Bonitätsgrenze wird zweimal halb ausgeschöpft statt einmal ganz. Wer seine Kennzahlen auswerten will, misst in einem dublettenbehafteten Bestand nicht das Geschäft, sondern die Datenqualität.
Bei Artikelsätzen ist die Wirkung noch direkter. Zwei interne Nummern für dasselbe Bauteil bedeuten zwei Bestände, zwei Mindestbestände und zwei Bestellvorschläge. Das Teil ist im System vorhanden und wird trotzdem nachbestellt, weil der eine Satz leer ist und der andere nicht. In der Inventur wird zweimal gezählt oder einmal übersehen. In der Produktion führt eine zweite Nummer für dasselbe Material dazu, dass Stücklisten auseinanderlaufen und Nachkalkulationen nicht vergleichbar sind.
- Doppelte Ansprache im Vertrieb: zwei Personen betreuen denselben Kunden, ohne den Verlauf der anderen zu sehen
- Rechnungen und Mahnungen an eine überholte Anschrift, weil die Adressänderung nur an einem der beiden Sätze gepflegt wurde
- Falsche Umsatz-, Bestands- und Deckungsbeitragsauswertungen, weil Beträge auf mehrere Sätze verteilt sind
- Unnötige Bestellungen und blockiertes Kapital, weil ein vorhandener Artikel unter einer zweiten Nummer geführt wird
- Erhöhter Aufwand bei jeder Massenkommunikation, weil Empfänger mehrfach angeschrieben werden
- Mehr Aufwand bei Auskunfts- und Löschanfragen, weil zuerst alle Sätze zu einer Person gefunden werden müssen
Der letzte Punkt hat auch eine rechtliche Seite. Die Datenschutz-Grundverordnung enthält den Grundsatz, dass personenbezogene Daten sachlich richtig und erforderlichenfalls auf dem neuesten Stand sein müssen (Europäische Kommission). Ein Bestand mit vielen Dubletten macht es schwerer, einer Auskunfts- oder Berichtigungsanfrage vollständig nachzukommen. Wie das im Einzelfall zu bewerten ist, gehört in die fachliche Prüfung mit Ihrer Rechtsberatung; dieser Beitrag ersetzt sie nicht.
Bestandsaufnahme: wie viele Dubletten stecken wirklich im Bestand?
Vor jeder Bereinigung steht eine Messung, und sie ist einfacher, als sie klingt. Ziel ist keine Zahl auf zwei Stellen hinter dem Komma, sondern eine Größenordnung: Reden wir über ein paar Dutzend Fälle oder über einen strukturellen Anteil des Bestands? Diese Antwort entscheidet darüber, ob eine Nachmittagsaktion genügt oder ob ein Werkzeug gebaut werden muss. Bilden Sie dafür Gruppen nach eindeutigen Merkmalen und zählen Sie, wie viele Sätze pro Gruppe zusammenfallen. Jede Gruppe ist noch keine Dublettenliste, sondern eine Kandidatenliste.
Schritt 1 Ausgangswert festhalten: Anzahl aller Kunden- und Artikelsätze
Schritt 2 Gruppe: gleiche Postleitzahl und gleiche Hausnummer
Schritt 3 Gruppe: gleiche E-Mail-Adresse, durchgängig klein geschrieben
Schritt 4 Gruppe: gleiche Telefonnummer ohne Leerzeichen und Trennzeichen
Schritt 5 Gruppe: gleiche Umsatzsteuer-Identifikationsnummer
Schritt 6 Gruppe Artikel: gleiche Hersteller- oder Lieferantennummer
Schritt 7 Treffer zusammenfassen = Kandidatenliste zur Prüfung
# Eine Kandidatengruppe ist noch keine Dublette
# Auswertung immer auf einer Kopie des Bestands, nie im laufenden System
# Ergebnis je Gruppe getrennt festhalten, damit die Regeln bewertbar bleibenNehmen Sie aus jeder Gruppe eine kleine Stichprobe und sehen Sie sich die Sätze wirklich an. Sie werden schnell merken, welche Regeln tragen und welche zu viele falsche Treffer erzeugen. Die gleiche Telefonnummer ist zum Beispiel bei Privatkunden ein starkes Merkmal, bei Firmenkunden mit einer zentralen Nummer ein schwaches. Die gleiche Postleitzahl mit gleicher Hausnummer trifft in ländlichen Gemeinden gut und in Bürohäusern schlecht. Halten Sie diese Beobachtungen schriftlich fest, denn sie sind die Grundlage für die späteren Vergleichsregeln.
Adressnormalisierung: die Vorarbeit, ohne die jeder Vergleich scheitert
Ein Vergleich kann nur finden, was vergleichbar gemacht wurde. Deshalb steht am Anfang die Normalisierung: Aus jedem Feld wird ein zusätzlicher Vergleichswert berechnet, der ausschließlich für den Abgleich dient und den Originalwert nicht verändert. Dieser Punkt ist wichtig genug für eine eigene Regel: Der angezeigte Wert bleibt, wie er ist; normalisiert wird nur eine Kopie im Hintergrund. Sonst schreibt eine Bereinigung Kundennamen um, und das fällt spätestens bei der nächsten Rechnung auf.
Rohwert Vergleichswert
Hauptstr. 12 a -> hauptstraße 12a
Haupt Straße 12A -> hauptstraße 12a
Haupt-Str. 12a -> hauptstraße 12a
(0 152) 288 173 86 -> 4915228817386
+49 152 28817386 -> 4915228817386
0152 / 28817386 -> 4915228817386
Name mit Rechtsform -> Rechtsform abtrennen und getrennt vergleichen
Postfach statt Straße -> eigenes Feld, nicht mit der Hausadresse mischen
c/o und Zusätze -> in ein eigenes Feld, nicht in die Straße
# Umlaute konsequent gleich behandeln, auf beiden Seiten des Vergleichs
# Vergleichswerte werden zusätzlich gespeichert, nie an die Stelle des OriginalsFür Adressen lohnt eine getrennte Behandlung von Straße, Hausnummer und Zusatz. Die Hausnummer sollte als eigenes Feld vorliegen, weil ein Vergleich sie streng prüfen muss, während der Straßenname unscharf verglichen werden darf. Ortsnamen sollten gegen die Postleitzahl geprüft werden, denn eine korrekte Postleitzahl mit falsch geschriebenem Ort ist ein sehr guter Treffer, eine falsche Postleitzahl bei gleichem Ort dagegen ein schwacher. Bei internationalen Adressen brauchen Länderkennzeichen und Postleitzahlformate eigene Regeln; wer nur im deutschsprachigen Raum arbeitet, spart sich diesen Aufwand.
Ohne Normalisierung findet auch das beste Vergleichsverfahren fast nichts. Der Grund ist einfach: Die Abweichungen zwischen zwei Dubletten liegen selten im Kern des Namens, sondern in genau den Bestandteilen, die die Normalisierung entfernt: Abkürzungen, Rechtsformen, Leerzeichen, Zeichensetzung, Groß- und Kleinschreibung. Wer die Normalisierung überspringt und gleich Ähnlichkeit misst, bekommt viele Prüffälle und wenige sichere Treffer, und die Bereinigung wird zu einer Handarbeit, die niemand zu Ende bringt.
Ähnlichkeit statt Gleichheit: wie der Vergleich funktioniert
Der eigentliche Abgleich vergleicht nicht ganze Datensätze, sondern einzelne Felder, und er liefert kein Ja oder Nein, sondern ein Maß für die Nähe zweier Werte. Zwei Namen, die sich in einem Buchstaben unterscheiden, sind sehr ähnlich; zwei Namen mit vertauschten Wortteilen sind es ebenfalls, obwohl kein Zeichen an derselben Stelle steht. Ein einfaches Verfahren zählt, wie viele Zeichenänderungen nötig wären, um einen Wert in den anderen zu überführen. Ein anderes vergleicht die Klangform, was bei am Telefon aufgenommenen Namen hilft. Ein drittes zerlegt beide Werte in kurze Zeichenfolgen und misst die Überschneidung, was gegen vertauschte Wortteile gut wirkt.
Diese Feldwerte werden anschließend gewichtet zusammengefasst. Nicht jedes Feld wiegt gleich schwer: Eine übereinstimmende Umsatzsteuer-Identifikationsnummer ist ein starkes Argument, eine übereinstimmende Postleitzahl allein ist fast bedeutungslos. Umgekehrt darf ein einzelnes abweichendes Feld einen Treffer nicht sofort verwerfen, denn genau darin unterscheiden sich Dubletten ja. Sinnvoll ist deshalb eine kleine, schriftlich festgehaltene Regelsammlung, die für jedes Feld sagt, wie streng verglichen wird und wie viel es zählt. Diese Sammlung gehört in die Prozessdokumentation, sonst weiß nach dem ersten Durchlauf niemand mehr, warum ein Fall in der Liste steht.
Starke Merkmale zuerst
Umsatzsteuer-Identifikationsnummer, Handelsregisternummer, Kundennummer beim Lieferanten, Hersteller- oder Lieferantenartikelnummer und die vollständige E-Mail-Adresse sind starke Merkmale. Stimmen sie überein, ist der Fall meist klar und braucht nur eine kurze Sichtprüfung.
Schwache Merkmale nur in Kombination
Ort, Postleitzahl, Branche oder eine zentrale Telefonnummer sagen für sich genommen wenig. Sie tragen erst, wenn mehrere von ihnen gleichzeitig passen. Wer sie einzeln hoch gewichtet, produziert Prüflisten, die niemand abarbeitet.
Hausnummer streng, Straße unscharf
Straßennamen werden unterschiedlich geschrieben, Hausnummern selten. Ein unscharfer Vergleich des Straßennamens bei strenger Prüfung der Hausnummer trifft deutlich zuverlässiger als ein unscharfer Vergleich der gesamten Adresszeile.
Gegenargumente mitführen
Unterschiedliche Umsatzsteuer-Identifikationsnummern, unterschiedliche Bankverbindungen oder ein klar abweichender Ansprechpartner sind Hinweise gegen eine Zusammenführung. Sie sollten den Gesamtwert senken und im Prüfbildschirm sichtbar sein, nicht stillschweigend untergehen.
Rechnerisch ist der vollständige Vergleich aller Sätze gegen alle Sätze bei größeren Beständen zu aufwendig. Deshalb wird vorher gruppiert: Nur Sätze, die in einem groben Merkmal übereinstimmen, etwa im ersten Buchstaben des normalisierten Namens zusammen mit der Postleitzahl, werden überhaupt gegeneinander geprüft. Diese Vorgruppierung senkt den Aufwand erheblich, hat aber einen Preis: Wer ein Gruppierungsmerkmal wählt, das in einer Dublette abweicht, findet sie nie. In der Praxis hilft es, zwei oder drei Gruppierungen nacheinander laufen zu lassen und die Ergebnisse zusammenzuführen.
Drei Klassen, drei Behandlungen
Aus dem gewichteten Vergleichswert entstehen drei Klassen, und diese Dreiteilung ist der eigentliche Kern eines belastbaren Vorgehens. Oberhalb einer hohen Schwelle liegt der sichere Treffer, unterhalb einer niedrigen Schwelle der klare Nichttreffer, dazwischen liegt der Prüffall. Die beiden Schwellen sind keine Naturkonstanten, sondern Einstellungen, die an einer Stichprobe kalibriert werden: Nehmen Sie einige Dutzend Paare, entscheiden Sie von Hand und sehen Sie nach, wo der Vergleich diese Entscheidungen abbildet.
| Merkmal | Sicherer Treffer | Prüffall | Kein Treffer |
|---|---|---|---|
| Typische Lage | Starkes Merkmal gleich, Rest passend | Adresse ähnlich, starkes Merkmal fehlt | Nur ein schwaches Merkmal gleich |
| Behandlung | Vorschlag zur Zusammenführung | Prüfliste für die Fachabteilung | Getrennt lassen |
| Wer entscheidet | Fachabteilung, Freigabe im Stapel | Fachabteilung, Fall für Fall | Niemand, nur dokumentieren |
| Aufwand je Fall | Sekunden | Minuten, teils mit Rückfrage | Kein Aufwand |
| Hauptrisiko | Übersehene Variante statt Dublette | Liste wächst schneller als sie abgearbeitet wird | Dublette bleibt unentdeckt |
| Gegenmaßnahme | Stichprobe nach jeder Freigabe | Feste Bearbeitungszeit im Wochenplan | Zweite Gruppierung mit anderem Merkmal |
Der Prüffall ist der Bereich, in dem die meisten Bereinigungsprojekte scheitern. Nicht, weil er fachlich schwierig wäre, sondern weil die Liste ohne feste Zuständigkeit und ohne feste Bearbeitungszeit einfach liegen bleibt. Planen Sie deshalb von Anfang an ein, wer wöchentlich wie lange daran arbeitet, und legen Sie die Liste dorthin, wo diese Personen ohnehin arbeiten. Eine Prüfliste in einem separaten Werkzeug, das niemand öffnet, ist eine Liste, die es nicht gibt.
Artikelsätze sind schwieriger als Kundensätze
Bei Kunden gibt es meist wenigstens ein starkes Merkmal: eine Anschrift, eine E-Mail-Adresse, eine Identifikationsnummer. Bei Artikeln fehlt das oft. Zwei Sätze für dasselbe Bauteil unterscheiden sich in der Bezeichnung, in der Reihenfolge der Attribute, in der Einheit und manchmal in der Verpackungsgröße. Eine Bezeichnung aus Materialangabe, Maß, Farbe und Norm lässt sich in vielen Reihenfolgen schreiben, und jede davon ist im Betrieb einmal verwendet worden. Deshalb trägt bei Artikeln der reine Textvergleich weniger weit als bei Kunden.
Was hier trägt, sind fremde Nummern: die Artikelnummer des Herstellers, die des Lieferanten, eine Normbezeichnung, eine Zeichnungsnummer. Diese Felder sind in vielen Beständen vorhanden, aber schlecht gepflegt, weil sie im Alltag niemand braucht. Genau deshalb lohnt es sich, sie im Zuge der Bereinigung nachzuziehen: Sie sind gleichzeitig das beste Vergleichsmerkmal und die beste Vorbeugung gegen künftige Dubletten. Wo diese Nummern fehlen, hilft nur eine Kombination aus normalisierter Bezeichnung, Einheit und Warengruppe, und die Ergebnisse gehören dann fast immer in die Prüfklasse.
- Einheit prüfen, bevor verglichen wird: Stück, Paket, Meter und Kilogramm dürfen nicht vermischt werden
- Verpackungseinheiten und Gebinde sind Varianten, keine Dubletten, und brauchen eine Verknüpfung statt einer Zusammenführung
- Auslaufartikel mit Nachfolger sind ebenfalls keine Dubletten, sondern eine Nachfolgebeziehung mit eigenem Feld
- Bezeichnungen in Attribute zerlegen: Material, Maß, Norm, Farbe getrennt vergleichen statt als ein Textfeld
- Stücklisten und offene Bestellungen vor der Zusammenführung prüfen, weil sie auf die alte Nummer verweisen
- Barcode- oder Etikettendruck nach der Bereinigung kontrollieren, damit im Lager keine Nummer ohne Kennzeichnung bleibt
Zusammenführen, ohne die Historie zu verlieren
Zusammenführen heißt nicht löschen. Ein Kundensatz mit Aufträgen, Rechnungen und Belegen darf nicht verschwinden, weil an ihm Vorgänge hängen, die aufbewahrungspflichtig sind. Der übliche Weg ist ein anderer: Ein Satz wird zum führenden Satz bestimmt, alle Verweise werden auf ihn umgehängt, und der unterlegene Satz bleibt bestehen, wird aber für die Neuanlage und die Suche gesperrt und trägt einen Verweis auf den führenden Satz. So bleibt jede alte Belegnummer auffindbar, und eine spätere Prüfung kann nachvollziehen, was zusammengeführt wurde.
Welcher Satz führt, ist eine fachliche Entscheidung und keine technische. Meist ist es der Satz mit den meisten Bewegungsdaten oder der jüngeren Anschrift, aber nicht immer: Wenn der ältere Satz eine gepflegte Bankverbindung, eine korrekte Umsatzsteuer-Identifikationsnummer und eine hinterlegte Zahlungsvereinbarung hat, ist er die bessere Grundlage. Deshalb sollte der Prüfbildschirm beide Sätze feldweise nebeneinander zeigen und pro Feld eine Auswahl zulassen, statt einen Satz pauschal zu übernehmen.
Schritt 1: Sicherung und Testlauf
Vor der ersten Zusammenführung wird eine vollständige Datensicherung erstellt und ihre Rücksicherung geprüft. Regelmäßige Datensicherungen gehören zu den Grundmaßnahmen der IT-Sicherheit (Bundesamt für Sicherheit in der Informationstechnik). Der erste Durchlauf findet auf einer Kopie statt, nicht im laufenden Betrieb.
Schritt 2: Führenden Satz bestimmen
Beide Sätze werden feldweise gegenübergestellt. Je Feld wird entschieden, welcher Wert übernommen wird. Abweichende Bankverbindungen, Steuernummern und Zahlungsvereinbarungen werden ausdrücklich bestätigt, nicht stillschweigend überschrieben.
Schritt 3: Verweise umhängen
Aufträge, Belege, Kontakte, Verträge, Zahlungen und Dokumente werden auf den führenden Satz umgehängt. Wichtig ist eine vollständige Liste der abhängigen Bereiche, bevor der erste Fall bearbeitet wird, denn ein vergessener Bereich zeigt sich oft erst Wochen später.
Schritt 4: Unterlegenen Satz stilllegen
Der zweite Satz wird nicht gelöscht, sondern gesperrt und mit einem Verweis auf den führenden Satz versehen. Alte Nummern bleiben damit recherchierbar, und in Schnittstellen zu anderen Systemen läuft nichts ins Leere.
Schritt 5: Protokollieren
Jede Zusammenführung wird mit Zeitpunkt, ausführender Person, beiden Satznummern und den je Feld getroffenen Entscheidungen festgehalten. Ohne dieses Protokoll ist eine Rücknahme praktisch unmöglich und eine spätere Nachfrage nicht zu beantworten.
Vor der ersten Zusammenführung wird eine vollständige Datensicherung erstellt und ihre Rücksicherung geprüft. Regelmäßige Datensicherungen gehören zu den Grundmaßnahmen der IT-Sicherheit (Bundesamt für Sicherheit in der Informationstechnik). Der erste Durchlauf findet auf einer Kopie statt, nicht im laufenden Betrieb.
Beide Sätze werden feldweise gegenübergestellt. Je Feld wird entschieden, welcher Wert übernommen wird. Abweichende Bankverbindungen, Steuernummern und Zahlungsvereinbarungen werden ausdrücklich bestätigt, nicht stillschweigend überschrieben.
Aufträge, Belege, Kontakte, Verträge, Zahlungen und Dokumente werden auf den führenden Satz umgehängt. Wichtig ist eine vollständige Liste der abhängigen Bereiche, bevor der erste Fall bearbeitet wird, denn ein vergessener Bereich zeigt sich oft erst Wochen später.
Der zweite Satz wird nicht gelöscht, sondern gesperrt und mit einem Verweis auf den führenden Satz versehen. Alte Nummern bleiben damit recherchierbar, und in Schnittstellen zu anderen Systemen läuft nichts ins Leere.
Jede Zusammenführung wird mit Zeitpunkt, ausführender Person, beiden Satznummern und den je Feld getroffenen Entscheidungen festgehalten. Ohne dieses Protokoll ist eine Rücknahme praktisch unmöglich und eine spätere Nachfrage nicht zu beantworten.
Prüfen Sie vor dem Umhängen, welche Nachbarsysteme die alte Nummer kennen. Ein Onlineshop, eine Zeiterfassung, ein Versanddienst oder eine Auswertung können auf den unterlegenen Satz verweisen. Wenn diese Systeme über Schnittstellen angebunden sind, muss die Zusammenführung dort ankommen oder wenigstens den Verweis auflösen können. Andernfalls entsteht die Dublette in den Nachbarsystemen erneut, sobald der nächste Abgleich läuft.
Warum automatisches Zusammenführen ohne Prüfung gefährlich ist
Ein Vergleichsverfahren kann sehr gut darin sein, Kandidaten zu finden, und trotzdem völlig ungeeignet sein, allein zu entscheiden. Der Grund liegt in der Beschaffenheit der Fehler. Wird eine echte Dublette nicht gefunden, bleibt der Zustand so, wie er ohnehin war: unangenehm, aber ohne neuen Schaden. Werden dagegen zwei verschiedene Sätze zusammengeführt, entsteht ein neuer, falscher Zustand, und die Vorgänge zweier verschiedener Kunden hängen anschließend an einem Satz. Diese beiden Fehler sind nicht gleich schwer, und deshalb darf man sie auch nicht gleich behandeln.
Besonders anfällig sind Fälle, die einem Vergleich sehr ähnlich vorkommen, fachlich aber getrennt gehören: zwei Filialen desselben Unternehmens an derselben Anschrift, zwei Personen mit gleichem Namen im selben Haus, Vater und Sohn im Familienbetrieb, eine Besitzgesellschaft und eine Betriebsgesellschaft mit identischer Adresse, eine Baustellenanschrift, die vorübergehend mit einer Firmenanschrift übereinstimmt. In all diesen Fällen ist die Ähnlichkeit hoch und die richtige Entscheidung lautet trotzdem: getrennt lassen. Zusammenführen ist eine fachliche Entscheidung, keine technische Operation.
Ein nicht gefundener Doppelsatz kostet Suchzeit. Eine falsch zusammengeführte Kundenbeziehung kostet Vertrauen, und sie lässt sich nur mit erheblichem Aufwand und selten vollständig zurückdrehen.
Automatik ja, aber nur bis zum Vorschlag
Vorbeugung: die Prüfung gehört in die Neuanlage
Eine einmalige Bereinigung ist eine Momentaufnahme. Ohne Vorbeugung sieht der Bestand nach einiger Zeit wieder so aus wie vorher, weil die Ursache unverändert ist. Der wirksamste Hebel liegt deshalb an der Stelle, an der Dubletten entstehen: bei der Neuanlage. Sobald Name und Postleitzahl oder Bezeichnung und Herstellernummer eingegeben sind, sucht das System im Bestand und zeigt ähnliche Sätze an, bevor gespeichert wird. Der entscheidende Punkt ist der Zeitpunkt: Eine Prüfung nach dem Speichern erzeugt nur eine weitere Liste, eine Prüfung vor dem Speichern verhindert den Satz.
Damit diese Prüfung angenommen wird, muss sie schnell und hilfreich sein. Eine Anzeige, die drei Sekunden braucht und dann eine unsortierte Liste zeigt, wird umgangen. Eine Anzeige, die sofort erscheint, die ähnlichsten Sätze zuerst zeigt und zu jedem Satz die letzte Bewegung nennt, spart der eingebenden Person Arbeit und wird deshalb genutzt. Gleiches gilt für die Suche: Viele Dubletten entstehen, weil die Suchfunktion nur den Namensanfang findet. Eine Suche, die auch mitten im Wort und über normalisierte Werte findet, verhindert mehr Dubletten als jede Regel.
Ergänzend hilft eine schmale Pflegeordnung: wer Stammsätze anlegen darf, welche Felder Pflicht sind, wie Rechtsformen und Adresszusätze geschrieben werden und wohin Änderungen gemeldet werden. Zwei Seiten genügen. Wichtiger als der Umfang ist, dass die Regeln bei der Einführung am echten Vorgang gezeigt werden und nicht als Anhang verteilt werden, den niemand liest.
Einführung: Reihenfolge, Zuständigkeit und Nachweis
Beginnen Sie mit dem Bestand, der den größten Schaden verursacht, und das sind in den meisten Betrieben die Kundensätze, weil an ihnen Rechnungen und Kommunikation hängen. Arbeiten Sie dort zuerst die sicheren Treffer ab, weil sie schnell gehen und ein sichtbares Ergebnis liefern. Erst danach lohnt der Einstieg in die Prüffälle, und erst danach der Artikelbestand. Der weit überwiegende Teil der Unternehmen in Deutschland sind kleine und mittlere Unternehmen (Statistisches Bundesamt), und dort gibt es keine Stabsstelle für Datenqualität: Ein Vorgehen, das mehr als wenige Stunden pro Woche verlangt, wird nicht durchgehalten.
Benennen Sie eine zuständige Person je Bestand. Nicht als zusätzliche Aufgabe im Organigramm, sondern als klare Antwort auf die Frage, wer im Zweifel entscheidet, ob zwei Sätze derselbe Kunde sind. Ohne diese Person wandern Prüffälle im Kreis, und die Liste wächst schneller, als sie abgearbeitet wird. Bei Artikeln ist die Zuständigkeit meist geteilt zwischen Einkauf und Lager; dann braucht es eine Absprache, wer den Ausschlag gibt.
Messen Sie zum Schluss dasselbe wie am Anfang: Anzahl der Sätze, Anzahl der Kandidatengruppen, Anzahl der offenen Prüffälle und die Zahl der Neuanlagen pro Monat. Die letzte Kennzahl ist die interessanteste, denn wenn die Neuanlagen nach Einführung der Prüfung deutlich zurückgehen, war der doppelte Bestand tatsächlich ein Ablaufproblem. Halten Sie den Ausgangswert und die Regeln fest, damit im nächsten Jahr niemand von vorn anfängt. Wenn die Bereinigung Teil einer größeren Aufräumaktion ist, gehört sie in den Ablauf einer Prozessanalyse und nicht in ein eigenes, isoliertes Vorhaben.
Verwandte Artikel
Stammdaten in Ordnung bringen: Kunden, Artikel, Lieferanten
Kunden, Artikel, Lieferanten: welches System führt, welche Pflichtfelder gelten und wie sich Stammdaten bereinigen lassen, ohne den Betrieb anzuhalten.
Tabellenkalkulation ablösen: wann es sich lohnt, wie es geht
Wenn eine Tabelle zum heimlichen Kernsystem wird: fünf Bruchstellen, drei Entscheidungsfragen und ein Umstellungsweg mit Parallelbetrieb statt Stillstand.
Texterkennung in der Praxis: was sie liest und was sie rät
Texterkennung realistisch bewertet: saubere Vorlagen gegen Durchschläge, Stempel und Handschrift, Erkennungsgüte messen, Felder auslesen, Aufwand je Belegtyp.