W fabryce BMW w Ratyzbonie kamera patrzy na lakierowaną maskę przesuwającą się po linii. Nie liczy, o ile mikronów kontur odbiega od wzorca. Ocenia. Sieć neuronowa rozstrzyga, czy nieregularność na powierzchni to prawdziwa wada, czy „pseudodefekt” – nieszkodliwy refleks, którego określony z góry próg błędu nie odróżniłby od zarysowania. Od 2023 r. Ratyzbona jest, jak deklaruje BMW, pierwszym zakładem motoryzacyjnym na świecie z w pełni zautomatyzowaną inspekcją i obróbką lakierowanych powierzchni w produkcji seryjnej. Werdykt zapada w milisekundach, zanim auto dojedzie do następnego stanowiska. I zapada bez człowieka.
Przez trzy dekady wizja przemysłowa działała regułą. Inżynier definiował obszar zainteresowania, ustawiał próg jasności, pisał warunek: jeśli kontur odbiega od wzorca o tyle, odrzuć. Działało, dopóki oświetlenie było stałe, detal ułożony powtarzalnie, a tło przewidywalne. Załamywało się na powierzchni błyszczącej, na tkaninie, która się marszczy, na odblasku, którego nie da się opisać liczbą. Cognex nazwał to wprost: są wady, których nie sposób wyszukać jawnie, bo za każdym razem wyglądają inaczej. Reguła nie ma jak ich złapać.
Głębokie uczenie odwróciło logikę. Zamiast pisać regułę, inżynier pokazuje przykłady. Cognex Deep Learning, dawniej ViDi, uczy się z obrazów „dobrych” i „złych”, a potem wskazuje odchylenia od normy, także takie, których nikt wcześniej nie zdefiniował regułą. To ta sama zmiana, która w slocie sterownika zamieniła ręcznie wpisany próg alarmowy na model statystyczny - równanie, którego nie napisał żaden programista. Kryterium jakości przestaje być zapisane w kodzie. Zaczyna mieszkać w zbiorze treningowym.
W kwietniu 2025 r. Keyence pokazał serię IV4 – czujnik wizyjny z wbudowaną AI, akceleratorem i całym przetwarzaniem w obudowie, bez specjalnie skonfigurowanego PC, do 15 tys. detali na minutę przy prostych detekcjach. Model, który jeszcze niedawno wymagał stacji z kartą graficzną, mieści się dziś w kostce niewiele większej od klasycznej fotokomórki. Seria VS tej samej firmy pakuje 25-megapikselowy tor inspekcji z AI i dziewiętnaście obiektywów w jedną obudowę IP67. Granica między „czujnikiem” a „systemem wizyjnym” – dwiema osobnymi pozycjami w katalogu – przestaje istnieć.
To nie są slajdy z targów. W Memmingen firma stoba oparła system kontroli optycznej InspectorONE na uczeniu głębokim - trzysekundowy takt, ok. 6 milionów zaworów wtryskowych skontrolowanych rocznie na trzy zmiany. BMW wdrożyło platformę AIQX we wszystkich zakładach. Według producenta to ponad czterysta rozwiązań AI, w Spartanburgu pół miliona zgrzein monitorowanych każdego dnia, decyzje liczone w milionach obrazów. Według prognoz rynkowych wartość rynku systemów wizyjnych rośnie z 20,4 mld dolarów w 2024 r. do 41,7 mld w roku 2030. Rockwell w tegorocznym badaniu State of Smart Manufacturing policzył, że 95% pytanych producentów zainwestowało albo planuje zainwestować w AI, a połowa wskazała kontrolę jakości jako najważniejszy cel wdrożeń.
Ten model, choćby najlepszy, wciąż mówi tylko: dobry albo odrzut. Nie tłumaczy dlaczego, nie napisze raportu jak kontroler z trzydziestoletnim stażem. Kolejny krok właśnie próbuje to zmienić. I jest niepokojący. Modele wizyjno-językowe opisują wadę słowami, przeprogramowuje się je zdaniem, ograniczają potrzebę zbierania tysięcy zdjęć i trenowania modelu od zera dla każdego nowego detalu. Według raportu o zwrocie z AI w produkcji z 2025 r. już 54% organizacji używających agentów AI kieruje je do kontroli jakości. W fazie produkcji jest ich jednak wciąż niewiele. Na brzegu sieci są wolniejsze, a jedna z prac benchmarkowych z ubiegłorocznego ICCV podsumowała je bez litości już w tytule: zunifikowane w teorii, zawodne w praktyce. Wyrok bywa pewny. Uzasadnienie – halucynowane.
Bo „pseudodefekt” tnie w obie strony. Sieć, która odrzuca nieszkodliwy refleks, z tą samą pewnością może uznać prawdziwą rysę za grę światła. Reguły nikt nie napisał, więc nikt jej do końca nie odczyta. Audytor wychowany na progach i tabelach staje przed modelem, który orzeka, ale się nie tłumaczy. Kryterium przeniosło się do zbioru treningowego, a ten jest dokładnie tak dobry, jak ci, którzy go opisali. Zbiór trzeba najpierw zbudować, czyli oznaczyć tysiące obrazów, zweryfikować oraz wytrenować model od nowa przy każdej zmianie detalu. Przekłada się to często na tygodnie pracy, których nie widać w folderze z parametrami.
Zmienia się przy tym człowiek przy kamerze. Inżynier wizji, który dobierał optykę, ustawiał oświetlenie i stroił progi, dziś selekcjonuje i opisuje obrazy, rozstrzyga spory z modelem, decydując, które jego werdykty są słuszne, a które to fałszywy alarm. Optykę i światło coraz częściej dobiera samo urządzenie - seria VS przełącza dziewiętnaście obiektywów jednym kliknięciem. Człowiekowi zostaje sąd nad sądem maszyny.
Kamera przez pół wieku raportowała: jest, nie ma, za jasno, za ciemno. Dziś patrzy, ocenia i orzeka. Pozostaje pytanie, czy fabryka jest gotowa dać temu wyrokowi tę samą powagę, z jaką traktuje odczyt z suwmiarki – i kto się pod nim podpisze.
Wyrok wydaje maszyna.
Apelację składa człowiek.
Anna Niedźwiedź