Amazon Textract
Amazon Textract
Serwis OCR i inteligentnej ekstrakcji danych z dokumentow. Wyciagaj tekst, tabele, pary klucz-wartosc z faktur, formularzy i dowodow tozsamosci.
Amazon Textract to serwis AI, ktory wykracza daleko poza tradycyjny OCR (Optical Character Recognition). Nie tylko rozpoznaje tekst na obrazach i dokumentach PDF, ale rowniez rozumie strukture dokumentu - wykrywa tabele, formularze (pary klucz-wartosc), a nawet potrafi odpowiadac na pytania dotyczace tresci dokumentu.
Textract oferuje specjalistyczne API: Analyze Expense (faktury i rachunki), Analyze ID (dokumenty tozsamosci), Analyze Lending (dokumenty kredytowe) oraz Queries - mozliwosc zadawania pytan o dokument w jezyku naturalnym.
Amazon Textract potrafi przetwarzac dokumenty wielostronicowe PDF asynchronicznie - wystarczy umiescic plik w S3 i uruchomic zadanie. Analyze Expense rozpoznaje faktury w dowolnym formacie, nawet zdjecia paragonow z telefonu. Queries pozwalaja "rozmawiac" z dokumentem jak z czlowiekiem.
Dla duzych wolumenow dokumentow uzyj asynchronicznych API (StartDocumentAnalysis) zamiast synchronicznych. Polacz Textract z Amazon Augmented AI (A2I), zeby ludzie weryfikowali wyniki o niskim poziomie pewnosci. Uzyj Queries zamiast parsowania calego dokumentu, gdy potrzebujesz tylko kilku konkretnych danych.
Textract to serwis OCR i ekstrakcji danych z dokumentow, ktory wykracza daleko poza zwykle rozpoznawanie tekstu. Rozumie strukture dokumentu: tabele, formularze, pola klucz-wartosc, a nawet odpowiada na pytania o zawartosc dokumentu.
Przeslanie dokumentu
Dokument przekazujesz jako bajty (do 10 MB, synchronicznie) lub wskazujesz plik na S3 (do 500 MB, asynchronicznie). Obslugiwane formaty: PDF (do 3000 stron), JPEG, PNG, TIFF. Dla synchronicznego API (DetectDocumentText, AnalyzeDocument) obslugiwana jest tylko jedna strona. Dla wielostronicowych PDF uzywaj asynchronicznych StartDocumentTextDetection/StartDocumentAnalysis.
Wybor typu ekstrakcji
DetectDocumentText - prosty OCR, zwraca linie i slowa. AnalyzeDocument - ekstrakcja struktury: TABLES (tabele z wierszami i kolumnami), FORMS (pary klucz-wartosc), QUERIES (odpowiedzi na pytania), SIGNATURES (wykrywanie podpisow). AnalyzeExpense - specjalizowany dla faktur i rachunkow. AnalyzeID - ekstrakcja danych z dokumentow tozsamosci.
Przetwarzanie przez modele ML
Textract uzywa modeli deep learning wytrenowanych na milionach dokumentow roznych typow. Modele rozumieja uklad dokumentu (layout analysis), relacje miedzy elementami (np. etykieta "Imie:" i wartosc "Jan") oraz strukture tabel. Dla Queries uzywasz pytania w jezyku naturalnym (np. "What is the patient name?") i Textract wskazuje odpowiedz w dokumencie.
Ekstrakcja tabel i formularzy
FeatureType TABLES zwraca tabele jako struktury z wierszami, kolumnami i komorkami. Kazda komorka ma tekst, confidence score i informacje o polaczeniach (merged cells). FeatureType FORMS zwraca pary klucz-wartosc: etykieta formularza (key) i wypelniona wartosc (value). Obydwa typy zawieraja geometry - wspolrzedne na stronie.
AnalyzeExpense dla faktur
AnalyzeExpense to specjalizowane API dla dokumentow finansowych. Automatycznie rozpoznaje: nazwe dostawcy, numer faktury, date, kwote netto/brutto/VAT, pozycje line items z opisem, iloscia i cena. Wynik jest ustrukturyzowany - nie musisz parsowac surowego tekstu. Obsluguje rozne formaty faktur bez konfiguracji.
Queries - pytania o dokument
Queries pozwalaja zadac pytania w jezyku naturalnym i uzyskac odpowiedz z dokumentu. Np. "What is the total amount?", "When is the due date?". Textract lokalizuje odpowiedz na stronie i zwraca tekst z confidence score i bounding box. Mozesz zadac do 15 pytan na strone. Queries sa idealne gdy struktura dokumentu jest zmienna.
Textract jest potezny out-of-the-box, ale optymalizacja jakosci ekstrakcji wymaga dbania o jakosc obrazu, post-processingu wynikow i przemyslanego podejscia do roznych typow dokumentow.
Jakosc skanu to fundament dokladnosci
Textract dziala najlepiej na dokumentach min. 150 DPI (optymalnie 300 DPI). Unikaj: przekrzywionych skanow (deskew przed wyslaniem), niskiego kontrastu (dostosuj brightness/contrast), rozmytego tekstu. Dla zdjec telefonem: dobre oswietlenie, brak cieni, dokument plasko. Preprocessing z OpenCV (deskew, denoise, binarize) moze poprawic dokladnosc o 10-20%.
PoczatkujacyQueries zamiast FORMS dla zmiennych layoutow
FeatureType FORMS dziala dobrze gdy etykiety sa blisko wartosci (klasyczny formularz). Gdy layout jest niestandaridowy (etykieta daleko od wartosci, brak wyraznych par), Queries daja lepsze wyniki. Formuluj pytania precyzyjnie: "What is the invoice number?" zamiast "Number". Mozesz laczyc FORMS i QUERIES w jednym wywolaniu.
ZaawansowanyPost-processing dla ekstrakcji tabel
Textract zwraca tabele jako zagniezdzone struktury Block. Uzyj biblioteki amazon-textract-response-parser (Python) lub textract-trp do konwersji na DataFrame. Sprawdzaj merged cells - Textract oznacza je, ale parsowanie wymaga logiki. Waliduj liczbe wierszy i kolumn. Dla tabel z wieloma stronami, lacz wyniki z kolejnych stron sprawdzajac kontynuacje naglowkow.
ZaawansowanyAnalyzeExpense zamiast custom parsowania faktur
Nie buduj wlasnego parsera faktur na AnalyzeDocument - AnalyzeExpense robi to za Ciebie. Zwraca ustrukturyzowane dane: SummaryFields (data, numer, kwoty) i LineItems (pozycje z cena, iloscia, opisem). Obsluguje rozne formaty faktur bez konfiguracji. Kosztuje tyle samo co AnalyzeDocument, ale daje znacznie lepsze wyniki dla dokumentow finansowych.
PoczatkujacyAsynchroniczne API dla duzych wolumenow
Synchroniczne API (AnalyzeDocument) obsluguje 1 strone na wywolanie. Dla wielostronicowych PDF uzywaj StartDocumentAnalysis. Ustaw SNS notification na zakonczenie job. Dla duzych wolumenow (tysiace dokumentow) buforuj przez SQS i kontroluj concurrency - Textract ma limity TPS per konto. Rozwaaz multi-region dla wiekszej przepustowosci.
ZaawansowanyAnalyzeID dla dokumentow tozsamosci
AnalyzeID rozpoznaje pola z dokumentow tozsamosci: imie, nazwisko, data urodzenia, numer dokumentu, data waznosci. Obsluguje dowody osobiste, paszporty i prawa jazdy z roznych krajow. Wynik to lista pol z NormalizedValue (ustandaryzowana forma np. daty). Uzywaj go zamiast recznego parsowania AnalyzeDocument dla ID documents.
PoczatkujacyScreenshoty z AWS Console
Wkrotce pojawia sie tu zrzuty ekranu pokazujace jak korzystac z Amazon Textract bezposrednio w konsoli AWS.
Do czego sluzy Amazon Textract?
Przetwarzanie faktur i rachunkow
Analyze Expense automatycznie wyciaga dane z faktur: numer, data, kwoty, pozycje, dane sprzedawcy i nabywcy.
Weryfikacja dokumentow tozsamosci
Analyze ID odczytuje dane z paszportow i dowodow osobistych: imie, nazwisko, data urodzenia, numer dokumentu.
Digitalizacja formularzy
Wyciagaj pary klucz-wartosc z wypelnionych formularzy papierowych - wnioski, ankiety, kwestionariusze.
Ekstrakcja danych z tabel
Automatycznie rozpoznawaj i eksportuj tabele z dokumentow do formatu strukturalnego (CSV, JSON).
Co musisz wiedziec?
Detect Text (OCR)
Podstawowe rozpoznawanie tekstu na obrazach i dokumentach PDF. Zwraca linie i slowa z pozycjami (bounding boxes).
Analyze Document (Forms & Tables)
Inteligentna analiza struktury dokumentu. Wykrywa pary klucz-wartosc (formularze) i tabele z wierszami/kolumnami.
Analyze Expense
Specjalistyczne API do faktur i rachunkow. Automatycznie rozpoznaje pola: numer faktury, data, kwoty, podatki, pozycje.
Analyze ID
API do dokumentow tozsamosci (paszporty, prawa jazdy). Wyciaga dane osobowe: imie, nazwisko, data urodzenia, numer dokumentu.
Queries
Zadawaj pytania o dokument w jezyku naturalnym, np. "Jaka jest data wystawienia?" - Textract znajdzie odpowiedz na podstawie tresci.
Analyze Lending
API do dokumentow kredytowych i hipotecznych. Klasyfikuje strony i wyciaga dane z roznych typow dokumentow w pakiecie.
Architektura: Automatyczne przetwarzanie faktur z Textract
Pipeline do automatycznego przetwarzania faktur od dostawcow. Textract wyciaga dane z roznych formatow faktur, waliduje je i wprowadza do systemu ERP bez recznej interwencji.
Ile kosztuje Amazon Textract?
Detect Text
Platnosc za strone dokumentu. Podstawowe OCR.
$1.50 za 1000 stron
Analyze Document
Platnosc za strone. Ekstrakcja formularzy i tabel.
Forms: $50/1000 stron, Tables: $15/1000 stron
Analyze Expense & ID
Platnosc za strone/dokument. Specjalistyczne API.
Expense: $10/1000 stron, ID: $2.50/1000 stron
Free Tier
1000 stron Detect Text i 100 stron Analyze miesiecznie przez 3 miesiace.
Wystarczy na prototypowanie
Przyklady AWS CLI
Wykryj tekst na obrazie
Podstawowe OCR - rozpoznaje tekst z obrazu w S3
aws textract detect-document-text \
--document "{\"S3Object\":{\"Bucket\":\"moj-bucket\",\"Name\":\"dokument.png\"}}"
Analizuj formularz
Wyciaga pary klucz-wartosc i tabele z dokumentu
aws textract analyze-document \
--document "{\"S3Object\":{\"Bucket\":\"moj-bucket\",\"Name\":\"formularz.pdf\"}}" \
--feature-types "[\"FORMS\",\"TABLES\"]"
Analizuj fakture
Wyciaga dane z faktury: numer, data, kwoty, pozycje
aws textract analyze-expense \
--document "{\"S3Object\":{\"Bucket\":\"moj-bucket\",\"Name\":\"faktura.pdf\"}}"
Zadaj pytanie o dokument
Queries - pytania w jezyku naturalnym o tresc dokumentu
aws textract analyze-document \
--document "{\"S3Object\":{\"Bucket\":\"moj-bucket\",\"Name\":\"umowa.pdf\"}}" \
--feature-types "[\"QUERIES\"]" \
--queries-config "Queries=[{Text=What is the contract date?}]"
Quiz: Amazon Textract
Sprawdz czy dobrze rozumiesz podstawy. Kliknij odpowiedz — feedback pojawi sie od razu.
1. Czym rozni sie Textract od zwyklego OCR?
2. Do czego sluzy Analyze Expense?
3. Co to sa Queries w Textract?
4. Ile stron Detect Text obejmuje Free Tier Textract?
Czesto uzywane razem z Amazon Textract
Chcesz poznac Amazon Textract w praktyce?
Darmowy kurs "AWS od podstaw" pokazuje jak uzywac Amazon Textract krok po kroku. Teoria + praktyka od zera.