Kontakt
Słownik pojęć e-MSI

OCR (Optical Character Recognition)

OCR to technologia optycznego rozpoznawania znaków, która zamienia obraz dokumentu — skan lub zdjęcie — w tekst możliwy do wyszukania i przetworzenia. OCR odczytuje znaki, ale sam nie rozumie, czym jest dokument ani które dane są istotne dla procesu.

2 pytań i odpowiedzi4 powiązane hasła

Gdzie OCR wystarcza, a gdzie nie

OCR świetnie sprawdza się przy uczytelnianiu archiwum i wyszukiwaniu pełnotekstowym w skanach. Do automatycznego księgowania faktur potrzeba więcej — klasyfikacji dokumentu i ekstrakcji konkretnych pól, czyli technologii IDR.

Co wpływa na jakość odczytu

  • Rozdzielczość i kontrast skanu.
  • Jakość oryginału — pieczątki, dopiski, zagięcia.
  • Język i obsługa polskich znaków diakrytycznych.
  • Tabele i układy wielokolumnowe.

W praktyce OCR jest pierwszym krokiem elektronicznego obiegu dokumentów, a nie całym rozwiązaniem.

Przykłady zastosowania

01

Skan umowy sprzed dziesięciu lat staje się przeszukiwalny po nazwisku kontrahenta.

02

Zdjęcie paragonu z telefonu zostaje odczytane i dołączone do rozliczenia delegacji.

Najczęstsze pytania

Czym różni się OCR od IDR?

OCR odczytuje tekst z obrazu, IDR dodatkowo rozpoznaje typ dokumentu i wyciąga z niego konkretne dane biznesowe.

Czy OCR radzi sobie z pismem odręcznym?

Częściowo. Rozpoznawanie pisma odręcznego jest znacznie mniej dokładne niż druku i zwykle wymaga weryfikacji przez człowieka.

Powiązane hasła

OCR (Optical Character Recognition) w praktyce

Zobacz, jak wygląda to w systemach, które wdrażamy w polskich firmach.

Przewijanie do góry