Przejdź do treści
← Realizacje

Serwis, który sam pisze sobie treści i odrzuca własne kłamstwa

Klient
TechSource (produkt własny)
Wdrożenie
wrzesień 2026
  • React
  • TypeScript
  • WebAssembly
  • Web Workers
  • launchd
  • Netlify

Zadanie

pdf.techsource.pro to zestaw darmowych narzędzi PDF: kompresja, scalanie, dzielenie i OCR. Wszystko liczy się w przeglądarce, przez WebAssembly. Plik nie wychodzi z urządzenia, więc nie ma serwera, kolejki, kopii na cudzym dysku ani polityki retencji do czytania.

Serwis powstał jako poligon jednego pytania: czy stronę treściową da się utrzymywać bez człowieka, nie schodząc przy tym do poziomu farmy tekstów.

Co zrobiliśmy

Narzędzia. Kompresja przez WebAssembly, OCR przez Tesseracta, obie rzeczy w Web Workerze, żeby zakładka nie zamarzała. Jedenaście języków OCR, wybranych nie z listy marketingowej, tylko z testu: zostały te, które osadzony font faktycznie koduje. Chiński, japoński i hindi wycięliśmy, bo dawały bajty zerowe zamiast słów.

Potok treści. Trzy agenty systemowe, bez ręcznej obsługi:

  • poniedziałek rano zbiera frazy z autouzupełniania wyszukiwarek i forów,
  • dwa razy w tygodniu pisze artykuł pod jedną frazę i publikuje go sam,
  • codziennie sprawdza, czy produkcja nie rozjechała się po cichu (tytuły, adresy kanoniczne, przekierowania, strony 404).

Warstwa, która decyduje o sensie całości. Każda strona musi nieść coś prawdziwego, czego nie ma konkurencja. Dlatego osobny harness uruchamia prawdziwy serwis w przeglądarce bez okna, na wygenerowanym korpusie dokumentów (skany 300 i 150 dpi z realnym skosem i szumem, dokument fotograficzny, PDF wektorowy), i zapisuje wyniki: rozmiar przed i po, czas, liczbę stron po obu stronach, dokładność OCR wobec wzorca.

Artykuły cytują te liczby, a generator odrzuca draft, który zacytuje jakąkolwiek inną. To nie jest ozdobnik. Model poproszony o tekst o kompresji sam z siebie sięga po „nawet 90 procent“, czyli dokładnie po twierdzenie, któremu ten serwis ma zaprzeczać.

Czego nauczył nas własny pomiar

Pomiar zrobiony porządnie zwykle najpierw uderza we właściciela.

Dwa z czterech ustawień kompresji nie robiły nic. Zero sekund, zero zmiany rozmiaru na każdym pliku. Interfejs oferował cztery, z czego dwa były atrapą. Wycięte.

PDF wektorowy puchł stukrotnie. Eksport z Worda, 16 kB na 20 stron, wychodził jako 1,74 MB. Nie było żadnego zabezpieczenia „nie zwracaj pliku większego niż wejściowy“, a opis na stronie mówił w tym miejscu, że plik „może się prawie nie zmienić“. Prawda była odwrotna. Dziś: 16 kB na wejściu, 16 kB na wyjściu.

OCR nie działał w ogóle, mimo że wyglądał na działający: kończył bez błędu i zwracał plik. Diagnoza i naprawa są opisane osobno, w post mortem po stronie serwisu. Po naprawie: 100 procent odzyskanych słów na wszystkich skanach z korpusu.

Opis na stronie też poszedł do poprawki, bo obiecywał wielojęzyczność, której nie było, i pełną pracę bez internetu, która dla OCR nie była prawdą.

Wynik

Serwis utrzymuje się sam: zbiera frazy, pisze, publikuje, pilnuje produkcji i raportuje. Obsługa z naszej strony to zero godzin miesięcznie, dopóki nic się nie psuje.

Ma też coś, czego nie publikuje żaden konkurent w tej kategorii: własne dane pomiarowe razem z korpusem i sposobem powtórzenia. Każdy tekst na tym serwisie można sprawdzić.

Eksperyment z ruchem organicznym jest w toku i to osobna historia. To, co już działa i można obejrzeć, to mechanizm: potok treści, który woli nie opublikować niczego, niż opublikować liczbę wziętą z powietrza.