OCR (Optical Character Recognition)
OCR to technologia optycznego rozpoznawania znaków, która zamienia obraz dokumentu — skan lub zdjęcie — w tekst możliwy do wyszukania i przetworzenia. OCR odczytuje znaki, ale sam nie rozumie, czym jest dokument ani które dane są istotne dla procesu.
Gdzie OCR wystarcza, a gdzie nie
OCR świetnie sprawdza się przy uczytelnianiu archiwum i wyszukiwaniu pełnotekstowym w skanach. Do automatycznego księgowania faktur potrzeba więcej — klasyfikacji dokumentu i ekstrakcji konkretnych pól, czyli technologii IDR.
Co wpływa na jakość odczytu
- Rozdzielczość i kontrast skanu.
- Jakość oryginału — pieczątki, dopiski, zagięcia.
- Język i obsługa polskich znaków diakrytycznych.
- Tabele i układy wielokolumnowe.
W praktyce OCR jest pierwszym krokiem elektronicznego obiegu dokumentów, a nie całym rozwiązaniem.
Przykłady zastosowania
Skan umowy sprzed dziesięciu lat staje się przeszukiwalny po nazwisku kontrahenta.
Zdjęcie paragonu z telefonu zostaje odczytane i dołączone do rozliczenia delegacji.
Najczęstsze pytania
Czym różni się OCR od IDR?
OCR odczytuje tekst z obrazu, IDR dodatkowo rozpoznaje typ dokumentu i wyciąga z niego konkretne dane biznesowe.
Czy OCR radzi sobie z pismem odręcznym?
Częściowo. Rozpoznawanie pisma odręcznego jest znacznie mniej dokładne niż druku i zwykle wymaga weryfikacji przez człowieka.
Powiązane hasła
Zobacz, jak wygląda to w systemach, które wdrażamy w polskich firmach.
