Problem uroborosa

Wewnątrz branży AI narasta cichy kryzys, a zaczyna się on od zwodniczo prostego pytania: co się dzieje, gdy modele AI trenują na danych wygenerowanych przez inne modele AI?

Odpowiedź, według rosnącego zbioru badań, brzmi: załamanie modelu. Wzorce się wyolbrzymiają. Błędy się utrwalają. Przypadki brzegowe znikają. Każde kolejne pokolenie modelu staje się nieco bardziej zniekształconym lustrem poprzedniego, aż wynik tylko z grubsza przypomina rzeczywistość, którą miał odwzorowywać.

Pomyśl o tym jak o kserowaniu kserokopii. Pierwsza kopia wygląda dobrze. Piąta jest już trochę rozmazana. Przy dwudziestej wpatrujesz się w obraz abstrakcyjny, który kiedyś był arkuszem kalkulacyjnym. Informacja nie tylko uległa degradacji. Została systematycznie zastąpiona artefaktami samego procesu kopiowania.

57%
treści w sieci jest szacunkowo wygenerowanych lub przetłumaczonych przez AI, wobec poniżej 5% w 2023 roku

Dlaczego dane syntetyczne są tak kuszące

Atrakcyjność jest oczywista. Dane ze świata rzeczywistego są kosztowne w zbieraniu, trudne w oczyszczaniu i często obwarowane przepisami o ochronie prywatności. Dane syntetyczne natomiast można generować na dużą skalę, kształtować tak, by wypełniały luki w zbiorach treningowych, i wytwarzać bez uciążliwych kwestii zgody i zgodności, które wiążą się z rzeczywistymi zapisami operacyjnymi.

W pewnych zastosowaniach dane syntetyczne sprawdzają się dobrze. Wzbogacanie zbiorów obrazów dla widzenia komputerowego. Testowanie przypadków brzegowych w symulacjach. Generowanie zbalansowanych zbiorów treningowych tam, gdzie dane rzeczywiste są przekrzywione. To uzasadnione, produktywne zastosowania.

Problem pojawia się, gdy dane syntetyczne przestają być uzupełnieniem, a zaczynają stawać się fundamentem. Gdy modele trenowane na wynikach syntetycznych wytwarzają nowe wyniki syntetyczne, które trenują kolejne pokolenie modeli, powstaje pętla sprzężenia zwrotnego bez kotwicy w rzeczywistości.

Dane syntetyczne wygładzają dokładnie te anomalie, które mają największe znaczenie. W łańcuchu dostaw anomalie to cała gra.


Problem łańcucha dostaw

Operacje łańcucha dostaw są z natury chaotyczne. Ciężarówki przyjeżdżają z opóźnieniem. Pracownicy zgłaszają chorobę. SKU są błędnie oznaczane. Paleta upada i blokuje alejkę na 45 minut. Przewoźnik zmienia strukturę stawek bez uprzedzenia. Sezonowy skok popytu uderza dwa tygodnie wcześniej, niż przewidział model.

Te anomalie, wyjątki i przypadki brzegowe to nie szum do odfiltrowania. To sygnał. Cała wartość inteligencji operacyjnej leży w wykrywaniu nieoczekiwanego, wyeksponowaniu wyjątku i zarekomendowaniu reakcji, zanim wyjątek przerodzi się w kryzys.

Operacje magazynowe pokazujące złożoność świata rzeczywistego
Rzeczywiste środowiska magazynowe generują chaotyczne, bogate w wyjątki dane, których modele AI potrzebują, by były naprawdę przydatne.

Model wytrenowany na syntetycznych danych magazynowych nauczy się, że tempo kompletacji podąża za gładkim rozkładem, że harmonogramy doków przebiegają zgodnie z planem, a stany magazynowe zgadzają się z zapisami systemu. Będzie niezmiernie pewny w świecie, który nie istnieje. W konfrontacji z rzeczywistym chaosem ruchliwego centrum dystrybucji zawiedzie albo po cichu (produkując wiarygodne, lecz błędne rekomendacje), albo głośno (oznaczając wszystko jako anomalię, bo nic nie pasuje do jego wypielęgnowanych danych treningowych).

3-8%
typowy odsetek niedokładności zapisów magazynowych w rzeczywistych magazynach, odchylenie, które modele oparte na danych syntetycznych konsekwentnie zaniżają

Ogon liczy się bardziej niż średnia

W statystyce "ogon" rozkładu opisuje rzadkie zdarzenia na skrajach. W generowaniu danych syntetycznych ogony są stopniowo przycinane w każdym pokoleniu. Model coraz lepiej poznaje przypadek przeciętny, tracąc jednocześnie kontrolę nad wyjątkami.

Ale w logistyce to właśnie w ogonie są pieniądze. Te 2% zamówień wymagających specjalnej obsługi. Przewoźnik, którego wyniki pogarszają się akurat w piątkowe popołudnia. SKU, który sprzedaje się stabilnie przez jedenaście miesięcy, a potem w 48. tygodniu skacze o 400%. Brama dokowa, której rozładunek trwa 15 minut dłużej, bo beton jest lekko nierówny i wózki paletowe się o niego zaczepiają.

  • Zdarzenia z ogona to miejsce, gdzie SLA są niedotrzymywane i narastają kary
  • Zdarzenia z ogona to miejsce, gdzie kumulują się incydenty bezpieczeństwa
  • Zdarzenia z ogona to miejsce, gdzie różnica między dobrym a świetnym operatorem staje się widoczna
  • Zdarzenia z ogona to dokładnie to, co dane syntetyczne eliminują w pierwszej kolejności

Prawda źródłowa jako fundament

Alternatywą dla syntetycznej pętli sprzężenia zwrotnego jest coś mało efektownego, ale skutecznego: buduj swoje AI na prawdziwych danych operacyjnych. Prawdziwe odczyty czujników. Prawdziwe zapisy transakcji. Prawdziwe znaczniki czasu z prawdziwych bram dokowych. Prawdziwe tempo kompletacji od prawdziwych pracowników na prawdziwych zmianach.

Z tymi danymi trudniej się pracuje. Mają luki. Mają błędy. Mają na sobie odciski ludzkiego zachowania, w tym te irracjonalne, niekonsekwentne, zależne od kontekstu zachowania, które sprawiają, że operacje logistyczne są tym, czym naprawdę są, a nie tym, czym według modelu powinny być.

Najlepsze operacyjne AI nie uczy się z idealnego świata. Uczy się z Twojego.

W blueclip to fundamentalny wybór projektowy, a nie funkcja. Platforma łączy się z Twoimi rzeczywistymi systemami operacyjnymi, wchłania Twoje rzeczywiste dane i buduje swoją inteligencję na realiach Twojej operacji. Bez syntetycznego wzbogacania. Bez generowanych danych treningowych. Każda rekomendacja daje się prześledzić wstecz do rzeczywistego zdarzenia, rzeczywistego pomiaru, rzeczywistego wzorca zaobserwowanego w Twoim środowisku.

Ma to znaczenie nie tylko dla dokładności, ale i dla zaufania. Gdy system mówi Ci, że wykorzystanie doków spada we wtorki i rekomenduje korektę harmonogramu, powinieneś móc prześledzić ten wniosek wstecz do rzeczywistych przyjazdów ciężarówek w rzeczywiste wtorki. Nie do statystycznego przybliżenia wygenerowanego przez model, który nigdy nie widział Twojego doku.


Droga przed nami

Apetyt branży AI na dane treningowe tylko rośnie, a w miarę jak internet wypełnia się treściami generowanymi przez AI, problem skażenia będzie się nasilał. Modele będą coraz częściej trenować na wynikach innych modeli, a pętla sprzężenia zwrotnego będzie się zacieśniać.

Dla przedsiębiorstw podejmujących decyzje na podstawie rekomendacji AI pytanie do dostawców jest proste: skąd pochodziły dane treningowe? Jeśli odpowiedź obejmuje generowanie syntetyczne, potoki wzbogacania danych lub mgliste odniesienia do "zastrzeżonych zbiorów danych", drąż dalej. Twoja operacja zasługuje na AI, które uczyło się z rzeczywistości, a nie z symulacji symulacji rzeczywistości.

Halę magazynu nie obchodzi wskaźnik pewności Twojego modelu. Obchodzi ją, czy rekomendacja rzeczywiście działa, gdy wózek widłowy się psuje, ciężarówka jest dwie godziny spóźniona, a połowa zespołu kompletacji nie przyszła do pracy.

Zobacz, jak blueclip buduje na prawdziwych danych →