softmedia/ digital systems
EN
System online00:00:00
ROOT / REALIZACJESECURE CONNECTION
CASE_03 / DATA_QUALITY

DbFixStudio: deduplikacja i normalizacja wieloletniej bazy klientów

DbFixStudio to dedykowany system do porządkowania, normalizacji i deduplikacji danych firmowych oraz klienckich. Łączy reguły jakości danych, mechanizmy podobieństwa, uczenie maszynowe i kontrolę operatora. Pomaga wykrywać duplikaty, rozróżniać oddziały tej samej organizacji, wyznaczać rekord główny i przygotowywać dane do bezpiecznego scalania lub dalszej analizy.

Typ projektu
dane ERP/CRM / jakość danych / uczenie maszynowe
Status
działający system rozwijany iteracyjnie
Czas
MVP w pierwszych tygodniach; około 8 miesięcy rozwoju obecnego zakresu
Zakres
DATA_QUALITY / DEDUPLIKACJA / ML.NET / SQL
01 / CASE_BLOCK

Problem

Wieloletnie bazy klientów i kontrahentów rzadko pozostają spójne. Dane są wprowadzane przez różne zespoły, importowane z kilku systemów i aktualizowane według zmieniających się zasad. Ta sama firma może występować pod różnymi nazwami, z innym adresem, niepełnym NIP-em albo przestarzałym kontaktem.

Proste porównanie identyczności nie wystarcza. Automatyczne scalanie na podstawie luźnego podobieństwa może natomiast połączyć dwie różne firmy albo odrębne oddziały. Potrzebna była automatyzacja pracochłonnej części procesu z kontrolą człowieka dla przypadków niejednoznacznych.

  • systemy ERP i CRM
  • pliki Excel i CSV
  • bazy SQL
  • importy zewnętrzne
  • historyczne systemy o zmiennej strukturze
02 / CASE_BLOCK

Zastosowane rozwiązanie

DbFixStudio prowadzi użytkownika przez cały projekt jakości danych: od importu, przez mapowanie i normalizację, do kontrolowanego eksportu wyniku.

  1. import danych z bazy SQL, pliku lub innego źródła
  2. mapowanie kolumn do znanych typów danych
  3. normalizacja według konfigurowalnych reguł
  4. blokowanie liczby porównań do sensownych kandydatów
  5. obliczenie podobieństwa dla poszczególnych pól
  6. ocena par i grup rekordów
  7. weryfikacja przez użytkownika
  8. trening modelu na zatwierdzonych decyzjach
  9. wybór rekordu głównego według reguł biznesowych
  10. eksport do dalszego przetwarzania
03 / CASE_BLOCK

Normalizacja danych

Wartości źródłowe pozostają zachowane do audytu. Normalizacja tworzy dodatkową warstwę do porównywania zamiast bezpowrotnie nadpisywać rekordy.

Osobny silnik adresowy rozdziela typ ulicy, nazwę, numer domu i lokalu. Obsługuje niespójne skróty, formaty numeracji, spacje i typowe warianty zapisu, co ogranicza fałszywe podobieństwa.

  • nazwy firm i formy prawne
  • NIP oraz identyfikatory
  • telefony i adresy e-mail
  • kody pocztowe i miejscowości
  • ulice, budynki i lokale
04 / CASE_BLOCK

Deduplikacja wspierana przez uczenie maszynowe

Różne pola mają różną wartość. Zgodny NIP jest silnym sygnałem, natomiast podobna nazwa bez zgodnego adresu nie zawsze oznacza ten sam podmiot.

Operator oznacza pary jako duplikat, brak duplikatu albo przypadek wymagający sprawdzenia. System wybiera wartościowe przypadki do uczenia i pokazuje podobieństwo pól, podpowiedź modelu oraz pomocniczą ocenę AI/LLM tam, gdzie jest używana.

Model nie wykonuje nieodwracalnego scalenia samodzielnie. Ostateczna decyzja pozostaje częścią kontrolowanego procesu.

05 / CASE_BLOCK

Różne profile deduplikacji

Jedna platforma wspiera kilka projektów jakości danych bez sprowadzania wszystkich przypadków do jednej definicji duplikatu.

  • bezpieczne scalanie klientów z wysokim progiem pewności
  • szersze wyszukiwanie relacji marketingowych
  • porządkowanie danych adresowych
  • wyznaczanie rekordu głównego według kompletności i źródła
06 / CASE_BLOCK

Panel weryfikacji

Webowy panel skraca pojedynczą decyzję i jednocześnie tworzy dane treningowe dla kolejnych iteracji modelu.

  • dwa porównywane rekordy
  • wartości oryginalne i znormalizowane
  • podobieństwo każdego pola
  • ocena modelu i pomocnicza ocena AI
  • historia decyzji
  • szybkie akcje: duplikat, nie duplikat, nie wiem
07 / CASE_BLOCK

Najważniejsze możliwości

  • import z baz SQL, plików i źródeł zewnętrznych
  • mapowanie dowolnych pól źródłowych
  • konfigurowalne reguły normalizacji
  • generowanie kandydatów z użyciem blokowania
  • porównywanie według wielu cech
  • weryfikacja par i całych grup
  • uczenie modelu na decyzjach operatora
  • oddzielne profile deduplikacji
  • wybór rekordu głównego
  • zachowanie danych źródłowych do audytu
  • eksport wyniku do scalania, raportowania lub analizy
08 / CASE_BLOCK

Rezultat biznesowy

DbFixStudio ogranicza liczbę rekordów wymagających ręcznego porównania i porządkuje decyzje o duplikatach. Organizacja otrzymuje powtarzalny proces z regułami, historią decyzji i możliwością doskonalenia modelu.

System przygotowuje dane do bezpiecznego scalania klientów, wyboru rekordów głównych, migracji i analiz. Lepsza normalizacja zmniejsza liczbę fałszywych dopasowań, a kontrola człowieka ogranicza ryzyko połączenia odrębnych podmiotów.

09 / CASE_BLOCK

Czas realizacji

Pierwsze MVP i test koncepcji powstały w ciągu kilku tygodni. Silnik normalizacji adresów, panel weryfikacji, uczenie modelu i profile rozwijano iteracyjnie. Obecny zakres rozwiązania powstał w okresie około ośmiu miesięcy.

TX / STACK

Technologie

  • .NET i ASP.NET Core
  • SQL i SQL Server LocalDB
  • ML.NET
  • HTML, CSS i JavaScript
  • Parsery adresowe i słowniki danych
  • Konfigurowalne reguły normalizacji
  • Przetwarzanie wsadowe
  • Integracje AI/LLM do pomocniczej oceny par
Realizacja i opracowanieSoftMedia
Autor / osoba odpowiedzialnaPiotr Szymański
Ostatnia aktualizacja
READY_FOR_DISCOVERY

Porozmawiajmy o podobnym wyzwaniu.

Opowiedz o projekcie