Amazon Transcribe
AI/ML Cloud Practitioner Solutions Architect Associate Machine Learning Specialty

Amazon Transcribe

Amazon Transcribe

Serwis speech-to-text zamieniajacy mowe na tekst. Transkrypcja w czasie rzeczywistym i batch, rozpoznawanie mowcow, redakcja PII i analiza rozmow.

Amazon Transcribe to serwis speech-to-text (STT), ktory automatycznie zamienia mowe na tekst. Wykorzystuje modele deep learning do dokladnej transkrypcji nagranych plikow audio/wideo oraz strumieni audio w czasie rzeczywistym. Obsluguje dziesiatki jezykow i potrafi automatycznie rozpoznac jezyk nagrania.

Transcribe oferuje zaawansowane funkcje: Speaker Diarization (rozpoznawanie kto mowi), Custom Vocabulary (slowa specjalistyczne), Content Redaction (maskowanie danych PII) oraz Call Analytics do analizy rozmow telefonicznych w contact center.

Czy wiesz, ze...

Amazon Transcribe potrafi automatycznie rozpoznac jezyk nagrania sposrod 100+ obslugiwanych jezykow - nie musisz go podawac. Transcribe Medical jest zgodny z HIPAA i rozpoznaje terminologie medyczna z dokladnoscia powyzej 95%.

Pro Tip

Dla nagranych rozmow telefonicznych uzyj Transcribe Call Analytics zamiast zwyklego Transcribe - dostaniesz nie tylko transkrypcje, ale tez analize sentymentu, wykrywanie problemow i metryki jakosci rozmowy. Custom Vocabulary znaczaco poprawia dokladnosc dla terminow branzowych.

Transcribe to serwis speech-to-text, ktory zamienia mowe na tekst uzywajac modeli automatycznego rozpoznawania mowy (ASR). Obsluguje transkrypcje batchowa z plikow i real-time streaming z mikrofonu lub strumienia audio.

1

Dostarczenie zrodla audio

Dla transkrypcji batchowej wskazujesz plik audio/wideo na S3 (formaty: MP3, MP4, WAV, FLAC, OGG, AMR, WebM). Maksymalny rozmiar to 2 GB, dlugosc do 4 godzin. Dla streaming transcription wysylasz audio w czasie rzeczywistym przez WebSocket lub HTTP/2 - Transcribe zwraca tekst z opoznieniem ok. 1-2 sekund.

2

Konfiguracja parametrow transkrypcji

Ustawiasz jezyk (lub wlaczasz automatyczna detekcje jezyka z max 5 kandydatow), sample rate, format audio. Opcjonalnie wlaczasz: Speaker Diarization (rozroznianie mowcow), Custom Vocabulary (slownictwo specjalistyczne), Vocabulary Filters (maskowanie slow), Content Redaction (ukrywanie PII) i Channel Identification (oddzielne kanaly np. klient/agent).

3

Przetwarzanie przez model ASR

Transcribe uzywa modeli deep learning (sequence-to-sequence z attention). Dla batch: StartTranscriptionJob uruchamia asynchroniczne zadanie, wynik trafia na S3. Dla streaming: audio jest przetwarzane w okienakch czasowych, wyniki wracaja jako partial results (niestabilne) i finalne segmenty (stabilne). Partial results umozliwiaja podglad w czasie rzeczywistym.

4

Speaker Diarization

Transcribe rozpoznaje roznych mowcow w nagraniu i oznacza fragmenty tekstu etykietami (Speaker_0, Speaker_1, ...). Musisz podac maksymalna liczbe mowcow (2-10). Dziala najlepiej gdy mowcy nie nakladaja sie na siebie. Wynik zawiera segmenty z przypisaniem do mowcy i timestampami poczatku/konca kazdego fragmentu.

5

Post-processing wynikow

Transcribe zwraca JSON z pelna transkrypcja, alternatywnymi rozpoznaniami (confidence scores), timestampami per-slowo, oznaczeniami mowcow. Automatycznie dodaje interpunkcje i wielkie litery. Content Redaction moze automatycznie maskowac dane osobowe (PII) w transkrypcji - imiona, numery telefonow, adresy.

6

Integracja z innymi serwisami

Wynik transkrypcji mozna automatycznie przeslac do Comprehend (analiza sentymentu rozmowy), Translate (tlumaczenie), S3 (archiwizacja). Amazon Transcribe Call Analytics to specjalizowana wersja dla call center - automatycznie analizuje sentyment, wykrywa problemy i mierzy czas ciszy w rozmowach telefonicznych.

Transcribe daje dobre wyniki out-of-the-box, ale dokladnosc mozna znaczaco poprawic custom vocabulary i optymalizacja jakosci audio. Ponizej wskazowki z wdrozen produkcyjnych.

Custom Vocabulary dla terminologii branzkowej

Domyslny model nie zna specjalistycznych terminow, nazw produktow czy akronimow. Custom Vocabulary to lista slow z opcjonalna wymowa (IPA/SoundsLike) i wyswietlana forma (DisplayAs). Np. slowo "EKS" moze byc rozpoznawane jako "eks" - dodaj je z DisplayAs="EKS". Limit to 50,000 slow. Aktualizuj vocabulary regularnie gdy pojawiaja sie nowe terminy.

Poczatkujacy

Vocabulary Filters do maskowania tresci

Vocabulary Filter automatycznie maskuje lub usuwa niechciane slowa z transkrypcji. Uzywaj do: usuwania wulgaryzmow, maskowania danych wrazliwych (nazwy klientow, numery kont), filtrowania slow-wypelniacz. Trzy trypy filtrowania: mask (***), remove (usun), tag (oznacz). Filtr jest znacznie szybszy niz post-processing regex.

Poczatkujacy

Jakosc audio to klucz do dokladnosci

Transcribe dziala najlepiej z audio 16kHz+, mono, bez szumu tla. Jezeli masz nagrania z telefonow (8kHz), uzyj NarrowBand modeli. Dla nagrania z spotkania uzyj WideBand. Preprocessing: normalizuj glosnosc, usun cisza na poczatku/koncu, zastosuj noise reduction. Kazdy 1dB poprawy SNR (signal-to-noise ratio) to ok. 1-2% lepsza dokladnosc.

Zaawansowany

Streaming z partial results stability

W trybie streaming Transcribe zwraca partial results (niestabilne - moga sie zmienic) i final results (stabilne). Parametr EnablePartialResultsStabilization z level High/Medium/Low kontroluje kompromis miedzy stabilnoscia a latency. High = mniej zmian ale wieksze opoznienie. Dla napisow na zywo uzywaj Medium, dla transkrypcji medycznej High.

Zaawansowany

Channel Identification dla call center

Nagrania stereo (agent na lewym kanale, klient na prawym) przetwarzaj z ChannelIdentification=true. Transcribe transkrybuje kazdy kanal oddzielnie, co daje znacznie lepsza dokladnosc niz Speaker Diarization na mono audio. Lacz z Call Analytics dla automatycznej analizy sentymentu per-kanal i wykrywania przerw w rozmowie.

Zaawansowany

Automatyczna detekcja jezyka

IdentifyLanguage automatycznie rozpoznaje jezyk z listy max 5 kandydatow. Jezeli wiesz, ze audio jest w jednym z 2-3 jezykow, ogranicz liste kandydatow - poprawia to dokladnosc i szybkosc. Dla srodowisk wielojezycznych (call center miedzynarodowy) uzywaj IdentifyMultipleLanguages, ktory obsluguje przelaczanie jezyka w jednym nagraniu.

Poczatkujacy

Screenshoty z AWS Console

Wkrotce pojawia sie tu zrzuty ekranu pokazujace jak korzystac z Amazon Transcribe bezposrednio w konsoli AWS.

Do czego sluzy Amazon Transcribe?

01

Napisy do wideo

Automatycznie generuj napisy (subtitles) do filmow, webinarow i materialow szkoleniowych w formatach SRT/VTT.

02

Analiza rozmow w contact center

Transcribe Call Analytics analizuje rozmowy telefoniczne: transkrypcja, sentyment, problemy, cisza, przerywanie.

03

Dokumentacja spotkan

Transkrybuj spotkania w czasie rzeczywistym z rozpoznawaniem kto mowi. Tworzenie automatycznych notatek ze spotkan.

04

Przeszukiwanie nagranych tresci

Zamien archiwa audio/wideo na przeszukiwalny tekst. Znajdz konkretne tematy w godzinach nagranych materialow.

Co musisz wiedziec?

Batch Transcription

Asynchroniczna transkrypcja plikow audio/wideo z S3. Idealna do przetwarzania nagranych materialow - wynik w formacie JSON.

Real-Time Transcription

Transkrypcja strumieniowa w czasie rzeczywistym przez WebSocket. Do zastosowan na zywo: napisy, notatki ze spotkan.

Speaker Diarization

Automatyczne rozpoznawanie i oznaczanie roznych mowcow w nagraniu. Transcribe przypisuje kazde zdanie do konkretnego mowcy.

Custom Vocabulary

Lista slow specjalistycznych, nazw wlasnych i skrotow, ktore Transcribe powinien rozpoznawac. Poprawia dokladnosc dla terminow domenowych.

Content Redaction

Automatyczne wykrywanie i maskowanie danych osobowych (PII) w transkrypcji: numery telefonow, adresy, numery kont.

Call Analytics

Zaawansowana analiza rozmow telefonicznych: transkrypcja, sentyment, wykrywanie problemow, metryki jakosci (cisza, przerywanie).

Architektura: Transkrypcja rozmow call center z Transcribe

System automatycznej transkrypcji i analizy rozmow telefonicznych. Nagrania z call center sa przetwarzane batchowo lub w czasie rzeczywistym, transkrybowane z rozpoznaniem mowcow i analizowane pod katem sentymentu i kluczowych tematow.

System telefoniczny Nagrania rozmow w formacie WAV stereo (agent + klient)
Upload WAV
Amazon S3 (raw audio)
Amazon S3 (raw audio) Surowe nagrania z metadanymi (agent ID, data, klient)
Transcription Job
Amazon Transcribe
Amazon Transcribe Call Analytics z Channel ID, Custom Vocabulary i PII redaction
JSON results
AWS Lambda
AWS Lambda Parsowanie wynikow, ekstrakcja metryk, routing do dalszej analizy
NLP analysis
Amazon Comprehend
Amazon Comprehend Analiza sentymentu, ekstrakcja encji i klasyfikacja tematow
Index
Amazon OpenSearch
Amazon OpenSearch Pelnotekstowe wyszukiwanie transkrypcji z facetami i filtrami
Uzyj S3 Event Notification z filtrem na suffix ".wav", aby automatycznie uruchamiac Lambda, ktora startuje Transcription Job - eliminuje to reczne przetwarzanie.
Custom Vocabulary z nazwami produktow, kodami bledow i terminologia firmowa moze poprawic dokladnosc o 10-30% w porownaniu do domyslnego modelu.
Content Redaction automatycznie maskuje PII w transkrypcji - wlacz ja domyslnie dla zgodnosci z RODO i minimalizacji przechowywania danych osobowych.

Ile kosztuje Amazon Transcribe?

Batch Transcription

Platnosc za sekunde przetworzonego audio. Cena spada przy wiekszym wolumenie.

$0.024 za minute audio (Standard)

Real-Time Streaming

Platnosc za sekunde strumieniowego audio. Nieco drozsza niz batch.

$0.024 za minute audio (Streaming)

Call Analytics

Platnosc za minute analizowanej rozmowy. Wlacza transkrypcje + analize.

$0.030 za minute rozmowy

Free Tier

60 minut transkrypcji miesiecznie przez 12 miesiecy.

Wystarczy na testowanie i prototypowanie

Przyklady AWS CLI

Uruchom transkrypcje batch

Transkrybuje plik audio z S3 z rozpoznawaniem mowcow

aws transcribe start-transcription-job \
 --transcription-job-name moje-nagranie \
 --language-code pl-PL \
 --media MediaFileUri=s3://moj-bucket/nagranie.mp3 \
 --settings ShowSpeakerLabels=true,MaxSpeakerLabels=4 \
 --output-bucket-name moj-bucket-wyniki

Sprawdz status transkrypcji

Pobiera status i wynik zadania transkrypcji

aws transcribe get-transcription-job \
 --transcription-job-name moje-nagranie \
 --query "TranscriptionJob.{Status:TranscriptionJobStatus,URI:Transcript.TranscriptFileUri}"

Utworz Custom Vocabulary

Dodaje slownik specjalistycznych terminow dla lepszej dokladnosci

aws transcribe create-vocabulary \
 --vocabulary-name moje-terminy \
 --language-code pl-PL \
 --phrases "CloudManiak" "AWS Lambda" "Amazon S3" "Kubernetes"

Lista zadan transkrypcji

Wyswietla ostatnie zadania transkrypcji i ich statusy

aws transcribe list-transcription-jobs \
 --status COMPLETED \
 --query "TranscriptionJobSummaries[].{Name:TranscriptionJobName,Status:TranscriptionJobStatus,Date:CreationTime}" \
 --output table

Quiz: Amazon Transcribe

Sprawdz czy dobrze rozumiesz podstawy. Kliknij odpowiedz — feedback pojawi sie od razu.

Twoj wynik: 0 / 4

1. Co to jest Speaker Diarization w Amazon Transcribe?

2. Do czego sluzy Custom Vocabulary?

3. Ile minut transkrypcji obejmuje Free Tier?

4. Ktora funkcja Transcribe maskuje dane osobowe w transkrypcji?

Chcesz poznac Amazon Transcribe w praktyce?

Darmowy kurs "AWS od podstaw" pokazuje jak uzywac Amazon Transcribe krok po kroku. Teoria + praktyka od zera.

Zacznij darmowy kurs Wszystkie serwisy