Overview
Przetwarzanie dokumentów księgowych (faktur, paragonów, wyciągów bankowych) to w większości firm wciąż proces ręczny i podatny na błędy. Oczywistą szansą wydaje się dziś zastosowanie potężnych, zewnętrznych modeli językowych (LLM, np. od OpenAI, Google czy Anthropic), które potrafią błyskawicznie zamienić nieustrukturyzowany PDF w czysty plik JSON.
Jednak na drodze do tej automatyzacji stoi potężny bloker prawny i biznesowy: RODO oraz polityka bezpieczeństwa.
Dokumenty księgowe są pełne danych osobowych (PII) – imion, nazwisk, adresów, numerów kont, telefonów. Wysyłanie pełnej, surowej treści faktury do zewnętrznego API AI stanowi bezpośrednie ryzyko wycieku danych, złamania umów i nałożenia potężnych kar finansowych.
Celem projektu było zbudowanie lokalnego potoku przetwarzania (pipeline), który wyciągnie ustrukturyzowane dane księgowe (kwoty, daty, numery, VAT), mając nałożone twarde ograniczenie architektoniczne: żadna rzeczywista dana osobowa nie może opuścić maszyny i trafić do zewnętrznej chmury.
Wyzwanie
Podczas fazy R&D szybko zderzyliśmy się z tzw. „Paradoksem Redakcji”. Zewnętrzne AI potrzebuje kontekstu, by dobrze działać, a ukrycie przed nim danych to inżynieryjne pole minowe.
Nasz eksperyment wykazał, że tradycyjne podejście oparte na Czarnej Liście (wykryj PII modelem NER, zamaskuj i wyślij resztę do AI) jest niebezpieczne. Modele probabilistyczne gubią się na nietypowych dokumentach (np. literówki OCR, zagraniczne nazwy spółek). Jeśli model przeoczy nazwisko w stopce, dane wyciekają. Aby zapewnić 100% bezpieczeństwa, nasza bramka fail-closed musiała zachowywać się tak agresywnie, że blokowała ponad 50% dokumentów, czyniąc system nieprzepustowym.
Z kolei odwrócenie logiki i stworzenie Białej Listy (wysyłanie do AI samego „anonimowego grafu” z koordynatami i referencjami, całkowicie ogołoconego z tekstu) sprawiło, że potężny chmurowy LLM stał się „ślepy”. Bez słów, które tłumaczą kontekst, AI gubiło się w arytmetyce i nie potrafiło dopasować ról do liczb.
Wyzwanie polegało na zaprojektowaniu systemu, który osiągnie akceptowalny poziom automatyzacji, porzucając wadliwe koncepcje hybrydowe na rzecz rozwiązań przewidywalnych.
Projekt wymagał:
- konstrukcyjnej gwarancji 0% wycieków PII (Zero Data Leakage),
- pełnej eliminacji zewnętrznych, chmurowych API (LLM firm trzecich),
- wdrożenia 100% lokalnej ekstrakcji, matematyki i geometrii dokumentu,
- wbudowania płynnej kolejki weryfikacji dla człowieka (HITL),
- przygotowania architektury pod przyszłe lokalne modele (On-Premise VLM).
Tolerancji na wycieki danych wrażliwych.
Proces musiał zagwarantować bezwzględne bezpieczeństwo RODO, niezależnie od jakości skanu OCR czy nietypowego formatu zagranicznej faktury.
Rozwiązanie
Podjęliśmy twardą decyzję inżynieryjną: odrzuciliśmy rynkowy „hype” na zewnętrzne modele LLM na rzecz bezkompromisowego bezpieczeństwa klienta. Zaprojektowaliśmy i wdrożyliśmy architekturę Local-First + Human-In-The-Loop (HITL).
Rozwiązanie obejmowało:
- Lokalny, wielowarstwowy silnik ekstrakcji: Połączenie inteligentnego odczytu struktury PDF i lokalnego OCR, działające w 100% na infrastrukturze odciętej od zewnętrznych LLM.
- Kryptograficzny Privacy Vault: Zastosowaliśmy rygorystyczną, lokalną tokenizację danych. System rozpoznaje strony transakcji i zastępuje je znacznikami, zapewniając pełną pseudonimizację procesów.
- Deterministyczny solver finansowy: Zamiast zgadywać, stworzyliśmy autorski silnik matematyczny, który na podstawie koordynatów geometrycznych i tożsamości księgowej (netto + VAT = brutto) lokalnie i bezbłędnie paruje kwoty.
- Zabezpieczenie Egress (Sieć): Stworzyliśmy ostateczny bezpiecznik na poziomie kodu. System skanuje każdy wychodzący bajt danych, dając konstrukcyjną gwarancję, że poufne informacje po prostu nie mają fizycznej ścieżki wyjścia na zewnątrz.
- Zarządzanie wyjątkami (HITL): Dokumenty jednoznaczne procesowane są w tle, a te wymagające atencji człowieka płynnie trafiają do dedykowanego panelu weryfikacyjnego.
Całość zaprojektowaliśmy jako zamknięty, lokalny system operacyjny, który łączy niezawodną matematykę z pracą człowieka, trwale odcinając się od ryzyka chmurowych wycieków danych.
Outcome
Dostarczyliśmy produkcyjny system OCR, który spełnia najwyższe rygory środowisk Enterprise. Zamiast eksperymentować na danych klienta w chmurze, dowieźliśmy stabilne, autorskie narzędzie z pełną gwarancją prywatności.
Silnik osiąga rewelacyjną precyzję dla krytycznych pół księgowych (np. waluty 100%, VAT 93%, kwoty Netto 91%), walidując je matematycznie bez najmniejszego udziału zewnętrznych serwerów sztucznej inteligencji.
Rezultaty wdrożenia:
Ryzyka wycieku PII (Konstrukcyjna
gwarancja bezpiecznika Egress)
Dokumentów w pełni procesowanych
bez dotknięcia przez człowieka (Zero-Touch)
Zbudowana przez nas izolowana infrastruktura stanowi idealny fundament. W kolejnym kroku umożliwia wpięcie bezpiecznych, lokalnych modeli (VLM / GPU on-premise), co docelowo pozwoli dobić do ponad 90% automatyzacji, z zachowaniem żelaznej zasady: ani jeden bajt danych nie trafia do zewnętrznych dostawców.
Before vs After
Jak wyglądała zmiana po wdrożeniu
Przed wdrożeniem:
- Ryzyko wycieku danych z faktur (PII) do publicznych modeli AI.
- Opieranie poprawności danych na „halucynacjach” sztucznej inteligencji.
- Ręczne, czasochłonne przepisywanie wszystkich dokumentów od zera.
- Brak technicznej kontroli nad tym, jakie dane fizycznie opuszczają firmę.
Po wdrożeniu:
- Konstrukcyjna gwarancja 0% wycieków danych dzięki bramce Egress.
- Bezbłędna, matematyczna walidacja kwot (Netto + VAT = Brutto).
- Ekstrakcja w tle z płynnym kierowaniem wyjątków do weryfikacji (HITL).
- Pełna szczelność systemu i 100% zgodności z wymogami RODO.
Zobacz analizy i artykuły powiązane
z wdrożeniem
Szczegółowe materiały dotyczące architektury, workflow, integracji i problemów technicznych, które pojawiły się podczas projektowania systemu.
- AI & OCR
- AI & OCR
- AI & OCR