Serwis, który sam pisze sobie treści i odrzuca własne kłamstwa
- Klient
- TechSource (produkt własny)
- Wdrożenie
- wrzesień 2026
- React
- TypeScript
- WebAssembly
- Web Workers
- launchd
- Netlify
Zadanie
pdf.techsource.pro to zestaw darmowych narzędzi PDF: kompresja, scalanie, dzielenie i OCR. Wszystko liczy się w przeglądarce, przez WebAssembly. Plik nie wychodzi z urządzenia, więc nie ma serwera, kolejki, kopii na cudzym dysku ani polityki retencji do czytania.
Serwis powstał jako poligon jednego pytania: czy stronę treściową da się utrzymywać bez człowieka, nie schodząc przy tym do poziomu farmy tekstów.
Co zrobiliśmy
Narzędzia. Kompresja przez WebAssembly, OCR przez Tesseracta, obie rzeczy w Web Workerze, żeby zakładka nie zamarzała. Jedenaście języków OCR, wybranych nie z listy marketingowej, tylko z testu: zostały te, które osadzony font faktycznie koduje. Chiński, japoński i hindi wycięliśmy, bo dawały bajty zerowe zamiast słów.
Potok treści. Trzy agenty systemowe, bez ręcznej obsługi:
- poniedziałek rano zbiera frazy z autouzupełniania wyszukiwarek i forów,
- dwa razy w tygodniu pisze artykuł pod jedną frazę i publikuje go sam,
- codziennie sprawdza, czy produkcja nie rozjechała się po cichu (tytuły, adresy kanoniczne, przekierowania, strony 404).
Warstwa, która decyduje o sensie całości. Każda strona musi nieść coś prawdziwego, czego nie ma konkurencja. Dlatego osobny harness uruchamia prawdziwy serwis w przeglądarce bez okna, na wygenerowanym korpusie dokumentów (skany 300 i 150 dpi z realnym skosem i szumem, dokument fotograficzny, PDF wektorowy), i zapisuje wyniki: rozmiar przed i po, czas, liczbę stron po obu stronach, dokładność OCR wobec wzorca.
Artykuły cytują te liczby, a generator odrzuca draft, który zacytuje jakąkolwiek inną. To nie jest ozdobnik. Model poproszony o tekst o kompresji sam z siebie sięga po „nawet 90 procent“, czyli dokładnie po twierdzenie, któremu ten serwis ma zaprzeczać.
Czego nauczył nas własny pomiar
Pomiar zrobiony porządnie zwykle najpierw uderza we właściciela.
Dwa z czterech ustawień kompresji nie robiły nic. Zero sekund, zero zmiany rozmiaru na każdym pliku. Interfejs oferował cztery, z czego dwa były atrapą. Wycięte.
PDF wektorowy puchł stukrotnie. Eksport z Worda, 16 kB na 20 stron, wychodził jako 1,74 MB. Nie było żadnego zabezpieczenia „nie zwracaj pliku większego niż wejściowy“, a opis na stronie mówił w tym miejscu, że plik „może się prawie nie zmienić“. Prawda była odwrotna. Dziś: 16 kB na wejściu, 16 kB na wyjściu.
OCR nie działał w ogóle, mimo że wyglądał na działający: kończył bez błędu i zwracał plik. Diagnoza i naprawa są opisane osobno, w post mortem po stronie serwisu. Po naprawie: 100 procent odzyskanych słów na wszystkich skanach z korpusu.
Opis na stronie też poszedł do poprawki, bo obiecywał wielojęzyczność, której nie było, i pełną pracę bez internetu, która dla OCR nie była prawdą.
Wynik
Serwis utrzymuje się sam: zbiera frazy, pisze, publikuje, pilnuje produkcji i raportuje. Obsługa z naszej strony to zero godzin miesięcznie, dopóki nic się nie psuje.
Ma też coś, czego nie publikuje żaden konkurent w tej kategorii: własne dane pomiarowe razem z korpusem i sposobem powtórzenia. Każdy tekst na tym serwisie można sprawdzić.
Eksperyment z ruchem organicznym jest w toku i to osobna historia. To, co już działa i można obejrzeć, to mechanizm: potok treści, który woli nie opublikować niczego, niż opublikować liczbę wziętą z powietrza.