Trefon.
Techniczne

Twoje dane nie są gotowe na AI

80% projektów AI upada, a #1 powodem nie jest model - to dane. Oto jak sprawdzić, czy twoje są gotowe, zanim wydasz pieniądze na AI.

Jacek Trefon · · 8 min

TL;DR

Pięć problemów z danymi zabija AI: rozproszone, niespójne, niekompletne, nieustrukturyzowane i przestarzałe. Siedem pytań do oceny gotowości. Najpierw wyczyść dane, potem buduj AI. AI na złych danych = pewne błędne odpowiedzi.

Twoje dane są bardziej bałaganiaste, niż myślisz

Każdy projekt AI zaczyna się od tego samego założenia: „nasze dane są w porządku”.

Nigdy nie są w porządku. Nigdy nie audytowałem firmy, której dane byłyby tak czyste, jak myśleli. Ani razu. Przez cztery lata budowania systemów AI.

To nie krytyka. To rzeczywistość. Dane degradują się z czasem. Systemy się zmieniają. Ludzie odchodzą. Dokumentacja dryfuje. Pola, które miały być wymagane, nie są. Formaty, które miały być standardem, nie są. Dane, które miały być w jednym systemie, są w trzech.

Firmy, które odnoszą sukces z AI, nie mają doskonałych danych. Mają uczciwe dane - wiedzą, co jest zepsute, wiedzą, co brakuje, i naprawiają to przed budową na tym fundamencie.

5 problemów z danymi, które zabijają AI

1. Rozproszone dane (siloed)

Twoje dane klientów są w CRM. Dane transakcji w ERP. Dane wsparcia w systemie zgłoszeń. Dane produktu w osobnej bazie. Żaden z tych systemów nie rozmawia ze sobą.

AI potrzebuje połączonych danych. Jeśli budujesz predyktor odejść klientów, AI musi widzieć dane CRM (kim są), dane transakcji (co kupili) i dane wsparcia (na co narzekali). Jeśli są w osobnych silosach bez wspólnego identyfikatora, AI nie połączy kropek.

Objaw: „Musielibyśmy wyeksportować z trzech systemów i scalić ręcznie”. Poprawka: Zbuduj potok danych konsolidujący źródła w jeden widok. Przed projektem AI.

2. Niespójne dane

To samo pole jest sformatowane różnie w rekordach. Numery telefonów: „+34 600 123 456”, „34600123456”, „+34-600-123-456”, „0034 600 123 456”. Nazwy firm: „ACME Corp”, „Acme Corporation”, „ACME”, „acme corp”. Daty: „2024-01-15”, „15/01/2024”, „15 sty 2024”.

Niespójność myli AI. Widzi cztery różne numery telefonów, gdy to ten sam numer. Widzi cztery różne firmy, gdy to ta sama firma. Wzorce, które powinny być oczywiste, są ukryte przez szum formatowania.

Objaw: „Mamy dużo duplikatów, ale nie jesteśmy pewni, ile”. Poprawka: Normalizacja danych - ustandaryzuj formaty, zdeduplikuj rekordy, zwaliduj względem danych referencyjnych.

3. Niekompletne dane

Pola są puste. Rekordy brakuje. CRM ma 60% wypełnienia pola „branża”. ERP brakuje adresów e-mail dla 40% rekordów. System wsparcia nie łączy zgłoszeń z kontami klientów.

Niekompletne dane oznaczają, że AI podejmuje decyzje na podstawie częściowych informacji. To jak proszenie kogoś o prognozę pogody z danymi o temperaturze, ale bez wilgotności, bez ciśnienia i bez prędkości wiatru.

Objaw: „Śledzimy to… czasem… gdy ktoś pamięta”. Poprawka: Zidentyfikuj, które pola są krytyczne dla twojego przypadku AI. Wzbogać je. Uczynij je wymaganymi w przyszłości. Zaakceptuj, że dane historyczne mogą być trwale niekompletne.

4. Nieustrukturyzowane dane

Twoje najcenniejsze dane są w dokumentach, e-mailach, PDF-ach, notatkach z spotkań i wiadomościach Slack. Nie w żadnej bazie danych. Nie są przeszukiwalne. Nie są ustrukturyzowane.

AI może pracować z nieustrukturyzowanymi danymi - to jedna z jego mocnych stron. Ale tylko jeśli możesz uzyskać do nich dostęp, zorganizować je i podać AI w sposób użyteczny. Jeśli wiedza instytucjonalna żyje w 10 000 PDF-ów rozrzuconych po SharePoint, to najpierw problem infrastruktury danych, nim problem AI.

Objaw: „Nasze procesy są udokumentowane… gdzieś… przez kogoś… kiedyś”. Poprawka: Inwentaryzacja, konsolidacja i indeksowanie dokumentów przed budową AI na tym fundamencie.

5. Przestarzałe dane

Twoje dane były dokładne, gdy wprowadzone. Ale to było 2 lata temu. Klienci zmienili pracę. Firmy się połączyły. Produkty wycofano. Ceny się zmieniły.

AI wytrenowane na przestarzałych danych daje rekomendacje w oparciu o świat, który już nie istnieje. Poleca produkty, których nie sprzedajesz. Kontaktuje się z klientami, którzy odeszli. Klasyfikuje transakcje używając nieaktualnych kategorii.

Objaw: „Zaktualizowaliśmy CRM… w 2023”. Poprawka: Ustanów cykle odświeżania danych. Zidentyfikuj, które dane zmieniają się często (ceny, zapasy, status klienta), a które są relatywnie stabilne (nazwa firmy, branża). Priorytetyzuj świeżość dla danych karmiących twoje AI.

Jak ocenić gotowość danych

Siedem pytań. Odpowiedz szczerze:

  1. Gdzie żyją twoje dane? Czy potrafisz wypisać każdy system, bazę i magazyn dokumentów w jednym zdaniu? Jeśli zajmuje to akapit, masz silosy.

  2. Kto jest właścicielem? Czy jest osoba odpowiedzialna za jakość danych w każdym systemie? Czy to „odpowiedzialność wszystkich” - co znaczy nikogo?

  3. Jak czyste są? Jaki procent rekordów jest kompletny? Jaki procent to duplikaty? Jaki procent ma problemy z formatowaniem? Jeśli nie wiesz, to odpowiedź: nie wiesz.

  4. Jak kompletne są? Jaki procent krytycznych pól jest wypełniony? Które pola rutynowo pozostają puste? Dlaczego?

  5. Jak spójne są? Czy te same pola są sformatowane tak samo w rekordach? Między systemami? Czy potrafisz scalić rekordy z różnych systemów bez ręcznego czyszczenia?

  6. Jak świeże są? Kiedy był ostatni update? Jak często się zmieniają? Czy jest proces odświeżania, czy dane zmieniają się tylko, gdy ktoś ręcznie je edytuje?

  7. Jak dostępne są? Czy twój zespół może dostać się do danych przez API? Przez zapytanie do bazy? Czy wymaga to eksportu, e-maila i okresu oczekiwania?

Jeśli nie potrafisz pewnie odpowiedzieć na te pytania, nie masz problemu gotowości danych. Masz problem świadomości danych. Audyt naprawia oba.

Checklista audytu danych

Przed budową AI, uruchom tę checklistę:

  • Inwentaryzacja źródeł: Wypisz każde źródło danych, jego format, właściciela i częstotliwość aktualizacji
  • Własność: Przypisz osobę do każdego źródła danych - nie zespół, osobę
  • Analiza duplikacji: Ile istnieje duplikatów rekordów? Jaka strategia dedup?
  • Ocena kompletności: Dla każdego krytycznego pola, jaki procent jest wypełniony?
  • Sprawdzenie spójności: Próbka 100 rekordów. Czy formaty są spójne? Czy wartości są poprawne?
  • Audyt dostępu: Czy możesz uzyskać dostęp do każdego źródła przez API lub bezpośrednie zapytanie? Jakie uwierzytelnianie jest potrzebne?
  • Niezawodność potoku: Jeśli zbudujesz potok danych, jak będziesz wiedzieć, gdy się psuje?

Jak wyglądają „gotowe dane”

  • Pojedyncze źródło prawdy dla każdego typu danych (lub udokumentowany proces łączenia źródeł)
  • Udokumentowany schemat - każde pole ma nazwę, typ, opis i regułę walidacji
  • >95% kompletności na krytycznych polach
  • Spójne formaty - to samo pole, ten sam format, każdy rekord
  • Regularne aktualizacje - dane odświeżają się wg harmonogramu, nie gdy ktoś pamięta
  • Dostępne przez API - nie tylko przez eksport CSV i e-mail

Jeśli jeszcze tam nie jesteś, to w porządku. Większość firm nie jest. Ale napraw to przed budową AI. AI na złych danych nie produkuje wyników „mniej więcej dobrych” - produkuje pewne błędne wyniki, które wyglądają wiarygodnie. To gorsze niż brak AI w ogóle.

Dlaczego większość konsultantów to pomija

Praca nad danymi nie jest efektowna. Nie produkuje dem. Nie robi wrażenia na prezentacjach. Nie ma momentu „wow”.

Ale to różnica między AI, które wchodzi, a AI, które upada. Zawsze.

Konsultant pomijający ocenę danych i skaczący do budowy modelu jest albo niedoświadczony, albo optymalizuje pod swój harmonogram, nie twój. Model to fajna część. Dane to ważna część.

FAQ

Jak długo trwa czyszczenie danych? 2-8 tygodni w zależności od liczby systemów, wolumenu danych i stanu bałaganu. Nie jest efektowne, ale jest fundamentem, na którym wszystko inne stoi.

Czy możemy robić AI i pracę nad danymi równolegle? Nie. AI na złych danych = złe AI. Możesz budować potok danych, oceniając podejście do modelu, ale dane muszą być gotowe przed trenowaniem lub pobieraniem. W przeciwnym razie budujesz na piasku.

Co jeśli nie mamy wystarczająco danych? Czasem odpowiedzią jest „zbierz najpierw więcej danych”. To frustrujące do usłyszenia, ale lepsze niż budowa AI, które nie działa. Alternatywnie użyj podejścia opartego na API, które nie wymaga twoich własnych danych treningowych - ale wciąż potrzebujesz czystych danych do pobierania i kontekstu.

Gotów zastosować to w swojej sytuacji?

Book an AI Readiness Call

Rozmowa 30-minutowa. Bez pitchu. Wyjdziesz z jednym konkretnym następnym krokiem - nawet jeśli nie my.

Jacek Trefon

Jacek Trefon

AI engineering leader. 28 years building technology, 4+ years building production AI systems. I help companies assess, architect, build, and deploy AI that actually ships. Based in Spain, working globally.