Amazon Textract
AI/ML Cloud Practitioner Solutions Architect Associate Machine Learning Specialty

Amazon Textract

Amazon Textract

Serwis OCR i inteligentnej ekstrakcji danych z dokumentow. Wyciagaj tekst, tabele, pary klucz-wartosc z faktur, formularzy i dowodow tozsamosci.

Amazon Textract to serwis AI, ktory wykracza daleko poza tradycyjny OCR (Optical Character Recognition). Nie tylko rozpoznaje tekst na obrazach i dokumentach PDF, ale rowniez rozumie strukture dokumentu - wykrywa tabele, formularze (pary klucz-wartosc), a nawet potrafi odpowiadac na pytania dotyczace tresci dokumentu.

Textract oferuje specjalistyczne API: Analyze Expense (faktury i rachunki), Analyze ID (dokumenty tozsamosci), Analyze Lending (dokumenty kredytowe) oraz Queries - mozliwosc zadawania pytan o dokument w jezyku naturalnym.

Czy wiesz, ze...

Amazon Textract potrafi przetwarzac dokumenty wielostronicowe PDF asynchronicznie - wystarczy umiescic plik w S3 i uruchomic zadanie. Analyze Expense rozpoznaje faktury w dowolnym formacie, nawet zdjecia paragonow z telefonu. Queries pozwalaja "rozmawiac" z dokumentem jak z czlowiekiem.

Pro Tip

Dla duzych wolumenow dokumentow uzyj asynchronicznych API (StartDocumentAnalysis) zamiast synchronicznych. Polacz Textract z Amazon Augmented AI (A2I), zeby ludzie weryfikowali wyniki o niskim poziomie pewnosci. Uzyj Queries zamiast parsowania calego dokumentu, gdy potrzebujesz tylko kilku konkretnych danych.

Textract to serwis OCR i ekstrakcji danych z dokumentow, ktory wykracza daleko poza zwykle rozpoznawanie tekstu. Rozumie strukture dokumentu: tabele, formularze, pola klucz-wartosc, a nawet odpowiada na pytania o zawartosc dokumentu.

1

Przeslanie dokumentu

Dokument przekazujesz jako bajty (do 10 MB, synchronicznie) lub wskazujesz plik na S3 (do 500 MB, asynchronicznie). Obslugiwane formaty: PDF (do 3000 stron), JPEG, PNG, TIFF. Dla synchronicznego API (DetectDocumentText, AnalyzeDocument) obslugiwana jest tylko jedna strona. Dla wielostronicowych PDF uzywaj asynchronicznych StartDocumentTextDetection/StartDocumentAnalysis.

2

Wybor typu ekstrakcji

DetectDocumentText - prosty OCR, zwraca linie i slowa. AnalyzeDocument - ekstrakcja struktury: TABLES (tabele z wierszami i kolumnami), FORMS (pary klucz-wartosc), QUERIES (odpowiedzi na pytania), SIGNATURES (wykrywanie podpisow). AnalyzeExpense - specjalizowany dla faktur i rachunkow. AnalyzeID - ekstrakcja danych z dokumentow tozsamosci.

3

Przetwarzanie przez modele ML

Textract uzywa modeli deep learning wytrenowanych na milionach dokumentow roznych typow. Modele rozumieja uklad dokumentu (layout analysis), relacje miedzy elementami (np. etykieta "Imie:" i wartosc "Jan") oraz strukture tabel. Dla Queries uzywasz pytania w jezyku naturalnym (np. "What is the patient name?") i Textract wskazuje odpowiedz w dokumencie.

4

Ekstrakcja tabel i formularzy

FeatureType TABLES zwraca tabele jako struktury z wierszami, kolumnami i komorkami. Kazda komorka ma tekst, confidence score i informacje o polaczeniach (merged cells). FeatureType FORMS zwraca pary klucz-wartosc: etykieta formularza (key) i wypelniona wartosc (value). Obydwa typy zawieraja geometry - wspolrzedne na stronie.

5

AnalyzeExpense dla faktur

AnalyzeExpense to specjalizowane API dla dokumentow finansowych. Automatycznie rozpoznaje: nazwe dostawcy, numer faktury, date, kwote netto/brutto/VAT, pozycje line items z opisem, iloscia i cena. Wynik jest ustrukturyzowany - nie musisz parsowac surowego tekstu. Obsluguje rozne formaty faktur bez konfiguracji.

6

Queries - pytania o dokument

Queries pozwalaja zadac pytania w jezyku naturalnym i uzyskac odpowiedz z dokumentu. Np. "What is the total amount?", "When is the due date?". Textract lokalizuje odpowiedz na stronie i zwraca tekst z confidence score i bounding box. Mozesz zadac do 15 pytan na strone. Queries sa idealne gdy struktura dokumentu jest zmienna.

Textract jest potezny out-of-the-box, ale optymalizacja jakosci ekstrakcji wymaga dbania o jakosc obrazu, post-processingu wynikow i przemyslanego podejscia do roznych typow dokumentow.

Jakosc skanu to fundament dokladnosci

Textract dziala najlepiej na dokumentach min. 150 DPI (optymalnie 300 DPI). Unikaj: przekrzywionych skanow (deskew przed wyslaniem), niskiego kontrastu (dostosuj brightness/contrast), rozmytego tekstu. Dla zdjec telefonem: dobre oswietlenie, brak cieni, dokument plasko. Preprocessing z OpenCV (deskew, denoise, binarize) moze poprawic dokladnosc o 10-20%.

Poczatkujacy

Queries zamiast FORMS dla zmiennych layoutow

FeatureType FORMS dziala dobrze gdy etykiety sa blisko wartosci (klasyczny formularz). Gdy layout jest niestandaridowy (etykieta daleko od wartosci, brak wyraznych par), Queries daja lepsze wyniki. Formuluj pytania precyzyjnie: "What is the invoice number?" zamiast "Number". Mozesz laczyc FORMS i QUERIES w jednym wywolaniu.

Zaawansowany

Post-processing dla ekstrakcji tabel

Textract zwraca tabele jako zagniezdzone struktury Block. Uzyj biblioteki amazon-textract-response-parser (Python) lub textract-trp do konwersji na DataFrame. Sprawdzaj merged cells - Textract oznacza je, ale parsowanie wymaga logiki. Waliduj liczbe wierszy i kolumn. Dla tabel z wieloma stronami, lacz wyniki z kolejnych stron sprawdzajac kontynuacje naglowkow.

Zaawansowany

AnalyzeExpense zamiast custom parsowania faktur

Nie buduj wlasnego parsera faktur na AnalyzeDocument - AnalyzeExpense robi to za Ciebie. Zwraca ustrukturyzowane dane: SummaryFields (data, numer, kwoty) i LineItems (pozycje z cena, iloscia, opisem). Obsluguje rozne formaty faktur bez konfiguracji. Kosztuje tyle samo co AnalyzeDocument, ale daje znacznie lepsze wyniki dla dokumentow finansowych.

Poczatkujacy

Asynchroniczne API dla duzych wolumenow

Synchroniczne API (AnalyzeDocument) obsluguje 1 strone na wywolanie. Dla wielostronicowych PDF uzywaj StartDocumentAnalysis. Ustaw SNS notification na zakonczenie job. Dla duzych wolumenow (tysiace dokumentow) buforuj przez SQS i kontroluj concurrency - Textract ma limity TPS per konto. Rozwaaz multi-region dla wiekszej przepustowosci.

Zaawansowany

AnalyzeID dla dokumentow tozsamosci

AnalyzeID rozpoznaje pola z dokumentow tozsamosci: imie, nazwisko, data urodzenia, numer dokumentu, data waznosci. Obsluguje dowody osobiste, paszporty i prawa jazdy z roznych krajow. Wynik to lista pol z NormalizedValue (ustandaryzowana forma np. daty). Uzywaj go zamiast recznego parsowania AnalyzeDocument dla ID documents.

Poczatkujacy

Screenshoty z AWS Console

Wkrotce pojawia sie tu zrzuty ekranu pokazujace jak korzystac z Amazon Textract bezposrednio w konsoli AWS.

Do czego sluzy Amazon Textract?

01

Przetwarzanie faktur i rachunkow

Analyze Expense automatycznie wyciaga dane z faktur: numer, data, kwoty, pozycje, dane sprzedawcy i nabywcy.

02

Weryfikacja dokumentow tozsamosci

Analyze ID odczytuje dane z paszportow i dowodow osobistych: imie, nazwisko, data urodzenia, numer dokumentu.

03

Digitalizacja formularzy

Wyciagaj pary klucz-wartosc z wypelnionych formularzy papierowych - wnioski, ankiety, kwestionariusze.

04

Ekstrakcja danych z tabel

Automatycznie rozpoznawaj i eksportuj tabele z dokumentow do formatu strukturalnego (CSV, JSON).

Co musisz wiedziec?

Detect Text (OCR)

Podstawowe rozpoznawanie tekstu na obrazach i dokumentach PDF. Zwraca linie i slowa z pozycjami (bounding boxes).

Analyze Document (Forms & Tables)

Inteligentna analiza struktury dokumentu. Wykrywa pary klucz-wartosc (formularze) i tabele z wierszami/kolumnami.

Analyze Expense

Specjalistyczne API do faktur i rachunkow. Automatycznie rozpoznaje pola: numer faktury, data, kwoty, podatki, pozycje.

Analyze ID

API do dokumentow tozsamosci (paszporty, prawa jazdy). Wyciaga dane osobowe: imie, nazwisko, data urodzenia, numer dokumentu.

Queries

Zadawaj pytania o dokument w jezyku naturalnym, np. "Jaka jest data wystawienia?" - Textract znajdzie odpowiedz na podstawie tresci.

Analyze Lending

API do dokumentow kredytowych i hipotecznych. Klasyfikuje strony i wyciaga dane z roznych typow dokumentow w pakiecie.

Architektura: Automatyczne przetwarzanie faktur z Textract

Pipeline do automatycznego przetwarzania faktur od dostawcow. Textract wyciaga dane z roznych formatow faktur, waliduje je i wprowadza do systemu ERP bez recznej interwencji.

Dostawca / Email Faktura jako PDF lub skan (email, upload, fax)
Upload PDF
Amazon S3 (inbox)
Amazon S3 (inbox) Bucket na przychodzace dokumenty z event notification
AnalyzeExpense
Amazon Textract
Amazon Textract AnalyzeExpense z ekstrakcja dostawcy, kwot i line items
Structured data
AWS Lambda (validation)
AWS Lambda (validation) Walidacja danych, mapowanie dostawcow, sprawdzanie duplikatow
Low confidence
Amazon A2I (review) Human review dla faktur z niskim confidence lub bledami walidacji
Insert
System ERP / DynamoDB
System ERP / DynamoDB Zwalidowane faktury gotowe do zatwierdzenia i platnosci
Ustaw prog confidence na 95% - faktury ponizej tego progu kieruj do recenzji ludzkiej przez A2I, co minimalizuje bledy w danych finansowych.
Przechowuj oryginalne PDF razem z wynikami ekstrakcji w S3 z wersjonowaniem - umozliwia to audyt i ponowne przetwarzanie przy aktualizacji modelu.
Dla faktur cyklicznych od tych samych dostawcow, buduj template matching w Lambda - porownuj strukture z poprzednimi fakturami i flaguj anomalie (np. nietypowa kwota).

Ile kosztuje Amazon Textract?

Detect Text

Platnosc za strone dokumentu. Podstawowe OCR.

$1.50 za 1000 stron

Analyze Document

Platnosc za strone. Ekstrakcja formularzy i tabel.

Forms: $50/1000 stron, Tables: $15/1000 stron

Analyze Expense & ID

Platnosc za strone/dokument. Specjalistyczne API.

Expense: $10/1000 stron, ID: $2.50/1000 stron

Free Tier

1000 stron Detect Text i 100 stron Analyze miesiecznie przez 3 miesiace.

Wystarczy na prototypowanie

Przyklady AWS CLI

Wykryj tekst na obrazie

Podstawowe OCR - rozpoznaje tekst z obrazu w S3

aws textract detect-document-text \
 --document "{\"S3Object\":{\"Bucket\":\"moj-bucket\",\"Name\":\"dokument.png\"}}"

Analizuj formularz

Wyciaga pary klucz-wartosc i tabele z dokumentu

aws textract analyze-document \
 --document "{\"S3Object\":{\"Bucket\":\"moj-bucket\",\"Name\":\"formularz.pdf\"}}" \
 --feature-types "[\"FORMS\",\"TABLES\"]"

Analizuj fakture

Wyciaga dane z faktury: numer, data, kwoty, pozycje

aws textract analyze-expense \
 --document "{\"S3Object\":{\"Bucket\":\"moj-bucket\",\"Name\":\"faktura.pdf\"}}"

Zadaj pytanie o dokument

Queries - pytania w jezyku naturalnym o tresc dokumentu

aws textract analyze-document \
 --document "{\"S3Object\":{\"Bucket\":\"moj-bucket\",\"Name\":\"umowa.pdf\"}}" \
 --feature-types "[\"QUERIES\"]" \
 --queries-config "Queries=[{Text=What is the contract date?}]"

Quiz: Amazon Textract

Sprawdz czy dobrze rozumiesz podstawy. Kliknij odpowiedz — feedback pojawi sie od razu.

Twoj wynik: 0 / 4

1. Czym rozni sie Textract od zwyklego OCR?

2. Do czego sluzy Analyze Expense?

3. Co to sa Queries w Textract?

4. Ile stron Detect Text obejmuje Free Tier Textract?

Chcesz poznac Amazon Textract w praktyce?

Darmowy kurs "AWS od podstaw" pokazuje jak uzywac Amazon Textract krok po kroku. Teoria + praktyka od zera.

Zacznij darmowy kurs Wszystkie serwisy