Przez trzydzieści godzin dwa agenty AI na własnym klastrze przepracowały metodą PZS Waldemara Czachorowskiego trzy niezależne kierunki rozwoju Numeriki. Jeden z nich odradziły.
Model GLM-5.3Sprzęt 4× DGX SparkMetoda PZS — 10 etapówPrzebiegi 5–7.09.2026
01
Co powstało
3
niezależne przebiegi
30
etapów analizy
45
wersji dokumentów
460 tys.
znaków strategii
142
źródła w przypisach
89
unikalnych domen
125
wiadomości między agentami
0,93
średnia pewność ustaleń
Wszystkie trzydzieści etapów zamknięto werdyktem PASS. Osiem wersji odesłano do poprawki, jedną odrzucono w całości. Dane leżą w bazie na Hermesie i w pamięci długoterminowej floty — nie w pliku, który da się zgubić.
02
Trzy marginesy
Metoda TOWS wybiera strategię przez porównanie czterech sum ważonych. Liczy się nie tylko która wygrała, ale o ile. Ten margines mówi, jak pewna jest decyzja.
Szkolenia
3,25
Rozstrzygnięte. Ofensywa wygrywa z zapasem.
Sparki
1,3
Wąsko. Ofensywa tylko po domknięciu luk.
jhonnys-brain
0,2
Na granicy. Defensywa o włos przed nadrabianiem.
Jak to czytać: margines powyżej 2,0 to decyzja rozstrzygnięta. Poniżej 1,0 — dwa scenariusze są praktycznie równorzędne i wybór zależy od założeń, które trzeba świadomie przyjąć. Przy jhonnys-brain różnica wynosi 1,2 procent.
03
Szkolenia
Strategia ofensywna — „compliance-first"
Wchodzić
Kwadrant
Suma
Znaczenie
SO — ofensywna
10,90
siły wykorzystują szanse
ST — konserwatywna
7,65
siły neutralizują zagrożenia
WT — defensywna
7,30
redukcja i obrona
WO — konkurencyjna
6,70
szanse łatają słabości
Środek ciężkości to iloczyn dwóch najwyżej ocenionych par: certyfikat ISO 29993 wraz z wpisem do BUR spotyka się z popytem wymuszonym przez AI Act, finansowanym z Krajowego Funduszu Szkoleniowego. Model wycenia obie te interakcje na 0,95 w skali do jedności.
Warunki konieczne — nie opcje
Pakiety dokumentacyjne KFS gotowe, zanim otworzy się nabór. Nabór trwa minimum pięć dni roboczych i jest ogłaszany dziesięć dni wcześniej. Kto pisze program po ogłoszeniu, nie zdąży.
Wyjście poza LinkedIn. Para „zero rozpoznawalności marki × jedyny kanał tracący zasięg" dostała wagę 0,90 — najwyższą w całej analizie.
Uwaga — błąd w tej analizie. Etap mapy grup twierdzi, że obowiązek wpisu do BUR eliminuje czterech z sześciu graczy z rynku dofinansowanego. Sprawdziłem to u źródła: Cognity ma aktywną kartę dostawcy w BUR, opartą na certyfikacie ISO 9001. Do bazy PARP wystarczy więc ogólny certyfikat jakości, nie tylko dedykowany szkoleniom ISO 29993. Fosa istnieje, ale jest węższa i nie wyklucza konkurencji. Recenzent tego nie złapał, bo weryfikował liczby, a nie statusy rejestrowe konkurentów.
04
Sparki
Ofensywa warunkowa — wdrożenia i utrzymanie
Wchodzić ostrożnie
Kwadrant
Suma
Znaczenie
SO — ofensywna
17,4
siły wykorzystują szanse
WO — konkurencyjna
16,1
szanse łatają słabości
WT — defensywna
15,2
redukcja i obrona
ST — konserwatywna
14,3
siły neutralizują zagrożenia
Odsprzedaż sprzętu odpada twardą liczbą: marża dystrybutora wynosi 6,84 procent brutto całego portfela. Przy pięciu tysiącach kapitału obrotowego zamrożenie osiemdziesięciu tysięcy w klastrze jest niewykonalne. Zostaje model, w którym sprzęt kupuje klient, a Numerika sprzedaje wdrożenie i utrzymanie — od dwudziestu pięciu do czterdziestu procent wartości wdrożenia rocznie.
Kanibalizacji szkoleń nie ma. Przecięcie segmentów jest puste: klient szukający dofinansowania z BUR to nie ten sam klient, który kupuje klaster za sto tysięcy.
Data graniczna: od sześciu do dwunastu miesięcy. Know-how czteronodowe jest już publicznie dostępne na GitHubie, a konkurent ma w ofercie konfiguracje od jednego do czterech węzłów. Bariera kompetencyjna eroduje sama z siebie.
05
jhonnys-brain
Strategia defensywna — nie monetyzować
Nie wchodzić
Kwadrant
Suma
Znaczenie
WT — defensywna
16,6
obrona i minimalizacja
WO — konkurencyjna
16,4
szanse łatają słabości
SO — ofensywna
12,4
siły wykorzystują szanse
ST — konserwatywna
11,2
siły neutralizują zagrożenia
To jedyny przebieg, w którym maszyna odradziła kierunek. Powodem nie jest słabość produktu, tylko tempo rynku.
Scenariusz „dostawcy modeli wbudowują pamięć z audytem" nie jest hipotezą — jest w trakcie realizacji.etap scenariuszy, wersja druga
Trzech z czterech największych dostawców ma to już wbudowane. Anthropic wypuścił zarządzaną pamięć dla agentów w otwartej becie w kwietniu, z dziennikiem audytu, atrybucją pochodzenia, cofaniem i redakcją danych. Google i AWS mają swoje odpowiedniki w pełnej dostępności.
Cztery premiery w siedem tygodni — Cloudflare, Microsoft, Weaviate, Mem0.
Ekonomia wejścia jest ujemna. Doprowadzenie do stanu instalowalnego to od siedmiu do dziesięciu tygodni pracy jedynej osoby technicznej. Koszt alternatywny: od czterdziestu do dziewięćdziesięciu tysięcy złotych utraconego przychodu ze szkoleń. Sufit cenowy tej kategorii w modelu samoobsługowym wynosi od dziewiętnastu do dwustu czterdziestu dziewięciu dolarów miesięcznie.
Co zostaje: jhonnys-brain jako przewaga wewnętrzna. Koszt utrzymania bliski zeru — cały stos to oprogramowanie otwarte plus lokalny model. Infrastruktura badawcza floty, brak rachunków za API i realny dowód produkcyjny na piętnastu agentach, który można pokazywać na szkoleniach bez ujawniania szczegółów.
Kiedy wrócić do tej decyzji
2 grudnia 2027 — wejście w życie przepisów AI Act dla systemów wysokiego ryzyka, jeśli zmaterializuje się popyt na pamięć z audytem.
Realne zapytanie od klienta o pamięć agentową na własnym serwerze.
Uwolnienie co najmniej połowy czasu osoby technicznej.
Pełne wejście OpenAI przy wciąż nietkniętej luce „własny serwer, wiele modeli".
06
Jak to działa
Nie jest to jeden model, któremu zadano pytanie. To dwa agenty w pętli sporu, na sprzęcie stojącym w domu, bez żadnego zewnętrznego API.
Strateg produkuje etap: prowadzi własny research w sieci, czyta źródła, zapisuje ustalenia z przypisami i wystawia dokument.
Recenzent dostaje pełną treść i robi własny research kontrolny. Nie ufa strategowi na słowo — sprawdza jego liczby i adresy u źródła. Wystawia werdykt: PASS, POPRAW albo ODRZUC.
Etap idzie dalej wyłącznie po PASS. Limit to trzy rundy; po ich wyczerpaniu etap przechodzi z adnotacją „niedomknięty".
Nad wszystkim stoi checklista dziesięciu grzechów metodologii Waldka — między innymi reguła, że szanse mogą pochodzić wyłącznie z otoczenia, nigdy z własnych działań firmy.
81
recenzji
44
przekazań między agentami
30
ustaleń badawczych
8
wersji odesłanych do poprawki
07
Co złapał recenzent
To jest ta część, dla której cała konstrukcja ma sens.
Zmyślona kara z AI Act
Strateg napisał, że złamanie artykułu czwartego zagrożone jest karą do pięciu milionów euro lub jednego procenta obrotu, powołując się na artykuł 99 ustęp 4 — i wstawił to jako argument sprzedażowy skierowany do menedżera HR.
Recenzent pobrał pełny tekst artykułu 99 z tej samej domeny, którą cytował strateg. Wykazał, że rozporządzenie zna trzy progi kar: trzydzieści pięć milionów euro lub siedem procent za praktyki zakazane, piętnaście milionów lub trzy procent za zamkniętą listę artykułów, siedem i pół miliona lub jeden procent za podanie błędnych informacji. Artykuł czwarty nie występuje w żadnym z nich — kary za jego naruszenie ustalają państwa członkowskie. Progu „pięć milionów, jeden procent" w AI Act po prostu nie ma.
Werdykt: odrzucić. Przy okazji recenzent sprawdził dziewięć innych liczb w tym samym dokumencie — wszystkie okazały się prawdziwe co do przecinka.
Ironia, którą recenzent zapisał sam: poprawiana wersja nosiła tytuł „korekta dat AI Act". Poprawiając precyzję prawną, strateg dołożył nową zmyśloną kwotę.
Nowe zachowanie modelu
W dwóch przebiegach strateg z własnej inicjatywy poprawił etap już zamknięty. Zaczynając kolejny krok, przeczytał skrzynkę, zobaczył swoją odrzuconą recenzję i napisał nową wersję poza pętlą — dokładnie tam, gdzie recenzent wskazał. W jednym przypadku była to korekta waluty w rundzie finansowania konkurenta: dolary zamiast euro.
Takie wersje zostają bez werdyktu, bo pętla etapu jest już zamknięta. Domyka je zwykły restart: kod rozpoznaje gotową wersję bez oceny i posyła ją prosto do recenzji zamiast produkować od nowa. Domknięcie zajęło jedenaście minut zamiast dwunastu godzin.
08
Zastrzeżenia
Poprawy nie można przypisać wyłącznie modelowi. Między przebiegiem lipcowym na GLM-5.2 a wrześniowym na GLM-5.3 przepisałem także briefy i instrukcje etapów. Zmieniły się dwie rzeczy naraz, więc porównanie nie jest czystym eksperymentem.
Wszystkie liczby sprawdzono u źródła — ale źródłem jest internet. To nie jest audyt ani due diligence.
Teza o BUR w przebiegu szkoleniowym jest błędna i została opisana wyżej. Reszta wniosków tego przebiegu stoi.
Sumy TOWS są tak wiarygodne jak wagi, które im przypisano. Waldek powtarza to zdanie na każdym warsztacie: tabele to tylko zestawienie matematyczne, klucz siedzi w wiarygodności kryteriów.
Czwarta warstwa — podział zasobów między trzy kierunki — nie została policzona. To decyzja właścicielska, nie zadanie dla modelu.