Amazon Transcribe
Amazon Transcribe
Serwis speech-to-text zamieniajacy mowe na tekst. Transkrypcja w czasie rzeczywistym i batch, rozpoznawanie mowcow, redakcja PII i analiza rozmow.
Amazon Transcribe to serwis speech-to-text (STT), ktory automatycznie zamienia mowe na tekst. Wykorzystuje modele deep learning do dokladnej transkrypcji nagranych plikow audio/wideo oraz strumieni audio w czasie rzeczywistym. Obsluguje dziesiatki jezykow i potrafi automatycznie rozpoznac jezyk nagrania.
Transcribe oferuje zaawansowane funkcje: Speaker Diarization (rozpoznawanie kto mowi), Custom Vocabulary (slowa specjalistyczne), Content Redaction (maskowanie danych PII) oraz Call Analytics do analizy rozmow telefonicznych w contact center.
Amazon Transcribe potrafi automatycznie rozpoznac jezyk nagrania sposrod 100+ obslugiwanych jezykow - nie musisz go podawac. Transcribe Medical jest zgodny z HIPAA i rozpoznaje terminologie medyczna z dokladnoscia powyzej 95%.
Dla nagranych rozmow telefonicznych uzyj Transcribe Call Analytics zamiast zwyklego Transcribe - dostaniesz nie tylko transkrypcje, ale tez analize sentymentu, wykrywanie problemow i metryki jakosci rozmowy. Custom Vocabulary znaczaco poprawia dokladnosc dla terminow branzowych.
Transcribe to serwis speech-to-text, ktory zamienia mowe na tekst uzywajac modeli automatycznego rozpoznawania mowy (ASR). Obsluguje transkrypcje batchowa z plikow i real-time streaming z mikrofonu lub strumienia audio.
Dostarczenie zrodla audio
Dla transkrypcji batchowej wskazujesz plik audio/wideo na S3 (formaty: MP3, MP4, WAV, FLAC, OGG, AMR, WebM). Maksymalny rozmiar to 2 GB, dlugosc do 4 godzin. Dla streaming transcription wysylasz audio w czasie rzeczywistym przez WebSocket lub HTTP/2 - Transcribe zwraca tekst z opoznieniem ok. 1-2 sekund.
Konfiguracja parametrow transkrypcji
Ustawiasz jezyk (lub wlaczasz automatyczna detekcje jezyka z max 5 kandydatow), sample rate, format audio. Opcjonalnie wlaczasz: Speaker Diarization (rozroznianie mowcow), Custom Vocabulary (slownictwo specjalistyczne), Vocabulary Filters (maskowanie slow), Content Redaction (ukrywanie PII) i Channel Identification (oddzielne kanaly np. klient/agent).
Przetwarzanie przez model ASR
Transcribe uzywa modeli deep learning (sequence-to-sequence z attention). Dla batch: StartTranscriptionJob uruchamia asynchroniczne zadanie, wynik trafia na S3. Dla streaming: audio jest przetwarzane w okienakch czasowych, wyniki wracaja jako partial results (niestabilne) i finalne segmenty (stabilne). Partial results umozliwiaja podglad w czasie rzeczywistym.
Speaker Diarization
Transcribe rozpoznaje roznych mowcow w nagraniu i oznacza fragmenty tekstu etykietami (Speaker_0, Speaker_1, ...). Musisz podac maksymalna liczbe mowcow (2-10). Dziala najlepiej gdy mowcy nie nakladaja sie na siebie. Wynik zawiera segmenty z przypisaniem do mowcy i timestampami poczatku/konca kazdego fragmentu.
Post-processing wynikow
Transcribe zwraca JSON z pelna transkrypcja, alternatywnymi rozpoznaniami (confidence scores), timestampami per-slowo, oznaczeniami mowcow. Automatycznie dodaje interpunkcje i wielkie litery. Content Redaction moze automatycznie maskowac dane osobowe (PII) w transkrypcji - imiona, numery telefonow, adresy.
Integracja z innymi serwisami
Wynik transkrypcji mozna automatycznie przeslac do Comprehend (analiza sentymentu rozmowy), Translate (tlumaczenie), S3 (archiwizacja). Amazon Transcribe Call Analytics to specjalizowana wersja dla call center - automatycznie analizuje sentyment, wykrywa problemy i mierzy czas ciszy w rozmowach telefonicznych.
Transcribe daje dobre wyniki out-of-the-box, ale dokladnosc mozna znaczaco poprawic custom vocabulary i optymalizacja jakosci audio. Ponizej wskazowki z wdrozen produkcyjnych.
Custom Vocabulary dla terminologii branzkowej
Domyslny model nie zna specjalistycznych terminow, nazw produktow czy akronimow. Custom Vocabulary to lista slow z opcjonalna wymowa (IPA/SoundsLike) i wyswietlana forma (DisplayAs). Np. slowo "EKS" moze byc rozpoznawane jako "eks" - dodaj je z DisplayAs="EKS". Limit to 50,000 slow. Aktualizuj vocabulary regularnie gdy pojawiaja sie nowe terminy.
PoczatkujacyVocabulary Filters do maskowania tresci
Vocabulary Filter automatycznie maskuje lub usuwa niechciane slowa z transkrypcji. Uzywaj do: usuwania wulgaryzmow, maskowania danych wrazliwych (nazwy klientow, numery kont), filtrowania slow-wypelniacz. Trzy trypy filtrowania: mask (***), remove (usun), tag (oznacz). Filtr jest znacznie szybszy niz post-processing regex.
PoczatkujacyJakosc audio to klucz do dokladnosci
Transcribe dziala najlepiej z audio 16kHz+, mono, bez szumu tla. Jezeli masz nagrania z telefonow (8kHz), uzyj NarrowBand modeli. Dla nagrania z spotkania uzyj WideBand. Preprocessing: normalizuj glosnosc, usun cisza na poczatku/koncu, zastosuj noise reduction. Kazdy 1dB poprawy SNR (signal-to-noise ratio) to ok. 1-2% lepsza dokladnosc.
ZaawansowanyStreaming z partial results stability
W trybie streaming Transcribe zwraca partial results (niestabilne - moga sie zmienic) i final results (stabilne). Parametr EnablePartialResultsStabilization z level High/Medium/Low kontroluje kompromis miedzy stabilnoscia a latency. High = mniej zmian ale wieksze opoznienie. Dla napisow na zywo uzywaj Medium, dla transkrypcji medycznej High.
ZaawansowanyChannel Identification dla call center
Nagrania stereo (agent na lewym kanale, klient na prawym) przetwarzaj z ChannelIdentification=true. Transcribe transkrybuje kazdy kanal oddzielnie, co daje znacznie lepsza dokladnosc niz Speaker Diarization na mono audio. Lacz z Call Analytics dla automatycznej analizy sentymentu per-kanal i wykrywania przerw w rozmowie.
ZaawansowanyAutomatyczna detekcja jezyka
IdentifyLanguage automatycznie rozpoznaje jezyk z listy max 5 kandydatow. Jezeli wiesz, ze audio jest w jednym z 2-3 jezykow, ogranicz liste kandydatow - poprawia to dokladnosc i szybkosc. Dla srodowisk wielojezycznych (call center miedzynarodowy) uzywaj IdentifyMultipleLanguages, ktory obsluguje przelaczanie jezyka w jednym nagraniu.
PoczatkujacyScreenshoty z AWS Console
Wkrotce pojawia sie tu zrzuty ekranu pokazujace jak korzystac z Amazon Transcribe bezposrednio w konsoli AWS.
Do czego sluzy Amazon Transcribe?
Napisy do wideo
Automatycznie generuj napisy (subtitles) do filmow, webinarow i materialow szkoleniowych w formatach SRT/VTT.
Analiza rozmow w contact center
Transcribe Call Analytics analizuje rozmowy telefoniczne: transkrypcja, sentyment, problemy, cisza, przerywanie.
Dokumentacja spotkan
Transkrybuj spotkania w czasie rzeczywistym z rozpoznawaniem kto mowi. Tworzenie automatycznych notatek ze spotkan.
Przeszukiwanie nagranych tresci
Zamien archiwa audio/wideo na przeszukiwalny tekst. Znajdz konkretne tematy w godzinach nagranych materialow.
Co musisz wiedziec?
Batch Transcription
Asynchroniczna transkrypcja plikow audio/wideo z S3. Idealna do przetwarzania nagranych materialow - wynik w formacie JSON.
Real-Time Transcription
Transkrypcja strumieniowa w czasie rzeczywistym przez WebSocket. Do zastosowan na zywo: napisy, notatki ze spotkan.
Speaker Diarization
Automatyczne rozpoznawanie i oznaczanie roznych mowcow w nagraniu. Transcribe przypisuje kazde zdanie do konkretnego mowcy.
Custom Vocabulary
Lista slow specjalistycznych, nazw wlasnych i skrotow, ktore Transcribe powinien rozpoznawac. Poprawia dokladnosc dla terminow domenowych.
Content Redaction
Automatyczne wykrywanie i maskowanie danych osobowych (PII) w transkrypcji: numery telefonow, adresy, numery kont.
Call Analytics
Zaawansowana analiza rozmow telefonicznych: transkrypcja, sentyment, wykrywanie problemow, metryki jakosci (cisza, przerywanie).
Architektura: Transkrypcja rozmow call center z Transcribe
System automatycznej transkrypcji i analizy rozmow telefonicznych. Nagrania z call center sa przetwarzane batchowo lub w czasie rzeczywistym, transkrybowane z rozpoznaniem mowcow i analizowane pod katem sentymentu i kluczowych tematow.
Ile kosztuje Amazon Transcribe?
Batch Transcription
Platnosc za sekunde przetworzonego audio. Cena spada przy wiekszym wolumenie.
$0.024 za minute audio (Standard)
Real-Time Streaming
Platnosc za sekunde strumieniowego audio. Nieco drozsza niz batch.
$0.024 za minute audio (Streaming)
Call Analytics
Platnosc za minute analizowanej rozmowy. Wlacza transkrypcje + analize.
$0.030 za minute rozmowy
Free Tier
60 minut transkrypcji miesiecznie przez 12 miesiecy.
Wystarczy na testowanie i prototypowanie
Przyklady AWS CLI
Uruchom transkrypcje batch
Transkrybuje plik audio z S3 z rozpoznawaniem mowcow
aws transcribe start-transcription-job \
--transcription-job-name moje-nagranie \
--language-code pl-PL \
--media MediaFileUri=s3://moj-bucket/nagranie.mp3 \
--settings ShowSpeakerLabels=true,MaxSpeakerLabels=4 \
--output-bucket-name moj-bucket-wyniki
Sprawdz status transkrypcji
Pobiera status i wynik zadania transkrypcji
aws transcribe get-transcription-job \
--transcription-job-name moje-nagranie \
--query "TranscriptionJob.{Status:TranscriptionJobStatus,URI:Transcript.TranscriptFileUri}"
Utworz Custom Vocabulary
Dodaje slownik specjalistycznych terminow dla lepszej dokladnosci
aws transcribe create-vocabulary \
--vocabulary-name moje-terminy \
--language-code pl-PL \
--phrases "CloudManiak" "AWS Lambda" "Amazon S3" "Kubernetes"
Lista zadan transkrypcji
Wyswietla ostatnie zadania transkrypcji i ich statusy
aws transcribe list-transcription-jobs \
--status COMPLETED \
--query "TranscriptionJobSummaries[].{Name:TranscriptionJobName,Status:TranscriptionJobStatus,Date:CreationTime}" \
--output table
Quiz: Amazon Transcribe
Sprawdz czy dobrze rozumiesz podstawy. Kliknij odpowiedz — feedback pojawi sie od razu.
1. Co to jest Speaker Diarization w Amazon Transcribe?
2. Do czego sluzy Custom Vocabulary?
3. Ile minut transkrypcji obejmuje Free Tier?
4. Ktora funkcja Transcribe maskuje dane osobowe w transkrypcji?
Czesto uzywane razem z Amazon Transcribe
Chcesz poznac Amazon Transcribe w praktyce?
Darmowy kurs "AWS od podstaw" pokazuje jak uzywac Amazon Transcribe krok po kroku. Teoria + praktyka od zera.