Amazon Polly
Amazon Polly
Serwis text-to-speech zamieniajacy tekst w naturalna mowe. Glosy neuralne (NTTS) w ponad 30 jezykach - od audiobookow po asystentow glosowych.
Amazon Polly to serwis text-to-speech (TTS), ktory zamienia tekst w naturalna mowe ludzka. Wykorzystuje technologie deep learning do generowania glosow, ktore brzmia realistycznie i naturalnie. Polly obsluguje ponad 30 jezykow (w tym polski!) i oferuje dziesiatki roznych glosow.
Polly oferuje dwa typy glosow: Standard (klasyczna synteza) i Neural TTS (NTTS), ktory brzmi znacznie bardziej naturalnie. Dzieki SSML mozesz precyzyjnie kontrolowac wymowe, pauzy, intonacje i tempo mowy.
Amazon Polly obsluguje polskie glosy neuralne - Ola (kobiecy) i Jacek (meski). Speech Marks pozwalaja synchronizowac ruchy ust postaci animowanej z generowana mowa (lip-sync), co jest wykorzystywane w grach i aplikacjach VR.
Uzyj SSML do poprawy jakosci wymowy nazw wlasnych i skrotow. Tag
Polly zamienia tekst na naturalna mowe (text-to-speech) uzywajac modeli deep learning. Obsuguje dziesiatki jezykow i glosow, w tym zaawansowane glosy neuralne, ktore sa niemal nieodroznialne od ludzkiej mowy.
Przygotowanie tekstu wejsciowego
Tekst przekazujesz jako plain text lub SSML (Speech Synthesis Markup Language). Plain text jest prostszy, ale SSML daje kontrole nad wymowa, pauzami, intonacja i szybkoscia. Polly obsluguje do 3000 znakow na jedno wywolanie SynthesizeSpeech lub do 200,000 znakow dla asynchronicznych zadan (StartSpeechSynthesisTask).
Wybor glosu i silnika
Polly oferuje trzy silniki: Standard (najstarszy, najtanszy), Neural (naturalny, realistyczny) i Long-Form (zoptymalizowany dla dlugich tekstow jak audiobooki). Kazdy jezyk ma kilka glosow do wyboru. Dla polskiego dostepne sa glosy standardowe (Ewa, Maja, Jacek, Jan) oraz neuralny Ola. Neural brzmi znacznie bardziej naturalnie, ale kosztuje wiecej.
Synteza mowy
SynthesizeSpeech to synchroniczne API zwracajace strumien audio. Wynik moze byc w formacie MP3, OGG Vorbis lub PCM. Dla dlugich tekstow (powyzej 3000 znakow) uzyj StartSpeechSynthesisTask - Polly przetwarza tekst asynchronicznie i zapisuje wynik do S3. Otrzymujesz URL do pliku audio po zakonczeniu.
Leksykony wymowy
Leksykony (Lexicons) pozwalaja definiowac wlasna wymowe dla slow specyficznych: nazw wlasnych, akronimow, terminow branzkowych. Tworzysz leksykon w formacie PLS (Pronunciation Lexicon Specification) i dolaczasz go do zadania syntezy. Mozesz miec do 5 leksykonow na jedno wywolanie. Leksykon nadpisuje domyslna wymowe.
Znaczniki mowy (Speech Marks)
Polly moze generowac speech marks - metadane synchronizujace tekst z audio. Typy: sentence (poczatek zdania), word (poczatek slowa), viseme (ruchy ust), SSML (tagi SSML). Speech marks zwracane sa jako JSON z timestampami w milisekundach. Umozliwiaja karaoke-style highlighting tekstu i animacje ust postaci.
Real-time streaming
Polly obsluguje streaming audio - zaczyna odtwarzanie zanim caly tekst zostanie przetworzony. Uzywasz HTTP/2 streaming z SynthesizeSpeech i OutputFormat=pcm lub mp3. Latency dla pierwszego bajtu to ok. 200-500ms. Streaming jest kluczowy dla IVR (Interactive Voice Response) i asystentow glosowych, gdzie opoznienie jest krytyczne.
Polly daje dobre wyniki od razu, ale optymalizacja wymowy, kosztow i integracji wymaga doswiadczenia. Ponizsze wskazowki pomoga wyciagnac maksimum z text-to-speech.
SSML dla kontroli nad wymowa
Uzywaj tagow SSML: <break> dla pauz (np. <break time="500ms"/>), <emphasis> dla akcentow, <prosody> dla szybkosci i glosnosci, <phoneme> dla dokladnej wymowy trudnych slow, <say-as> dla dat, liczb, akronimow. SSML jest niezbedny dla profesjonalnych zastosowan - plain text czesto zle wymawia nazwy wlasne i skroty.
PoczatkujacyNeural vs Long-Form - wybierz odpowiedni silnik
Neural daje najlepsza jakosc dla krotkich tekstow (powiadomienia, komunikaty IVR, opisy produktow). Long-Form jest zoptymalizowany dla dlugich tresci (artykuly, audiobooki, raporty) - ma lepszy rhythm i intonacje na przestrzeni wielu akapitow. Standard uzywaj tylko jezeli budzet jest krytyczny lub potrzebujesz glosu niedostepnego w Neural.
PoczatkujacyCache audio w S3 lub CloudFront
Polly kosztuje $16/milion znakow (Neural) lub $100/milion (Long-Form). Jezeli generujesz audio dla tych samych tekstow wielokrotnie, cache wyniki. Hashuj tekst + glos + parametry, sprawdzaj cache przed wywolaniem Polly. Dla statycznych tresci (opisy produktow, komunikaty) generuj audio raz i serwuj z CloudFront.
ZaawansowanyLeksykony dla terminologii branzkowej
Polly moze zle wymawiac nazwy wlasne, akronimy i terminy techniczne. Stworz leksykon PLS z poprawna wymowa. Przyklad: slowo "AWS" czytane jako "A W S", nie "aws". Leksykony sa per-region - jezeli uzywasz Polly w wielu regionach, wgraj leksykon do kazdego. Testuj wymowe iteracyjnie - uzywaj tagu <phoneme alphabet="ipa"> dla precyzyjnej kontroli.
ZaawansowanyDziel dlugie teksty na segmenty
SynthesizeSpeech ma limit 3000 znakow. Dla dluzszych tekstow uzyj StartSpeechSynthesisTask (do 200,000 znakow) lub podziel tekst na akapity. Dziel na naturalnych granicach (koniec zdania, akapit), nie w srodku zdania. Lacz segmenty audio narzedziem ffmpeg z crossfade 50ms dla plynnego przejscia.
PoczatkujacySpeech marks do synchronizacji tekstu
Generuj speech marks (OutputFormat=json z SpeechMarkTypes=word,sentence) rownolegle z audio. Uzywaj ich do: podswietlania czytanego tekstu w UI (e-learning), animacji ust postaci (viseme marks), nawigacji w dlugim audio (sentence marks). Speech marks sa darmowe - nie doliczaja sie do limitu znakow.
ZaawansowanyScreenshoty z AWS Console
Wkrotce pojawia sie tu zrzuty ekranu pokazujace jak korzystac z Amazon Polly bezposrednio w konsoli AWS.
Do czego sluzy Amazon Polly?
Audiobooki i e-learning
Automatycznie generuj nagrania audio z artykulow, kursow i dokumentacji. Idealne do tworzenia podcastow i materialow szkoleniowych.
Asystenci glosowi i IVR
Dodaj naturalny glos do chatbotow (Lex), systemow telefonicznych (Connect) i asystentow glosowych w aplikacjach.
Dostepnosc (accessibility)
Udostepnij tresc tekstowa osobom niewidomym i slabowidzacym. Generuj wersje audio stron internetowych.
Powiadomienia glosowe
Generuj dynamiczne komunikaty glosowe dla systemow IoT, alertow, nawigacji i aplikacji mobilnych.
Co musisz wiedziec?
Neural TTS (NTTS)
Zaawansowane glosy oparte na deep learning, ktore brzmia prawie jak prawdziwy czlowiek. Znacznie lepsza jakosc niz Standard, ale drozsze.
Standard Voices
Klasyczne glosy oparte na concatenative synthesis. Tansze, ale brzmia mniej naturalnie. Nadal dobre do prostych zastosowan.
SSML (Speech Synthesis Markup Language)
Jezyk znacznikow do kontroli wymowy: pauzy (<break>), emfaza (<emphasis>), tempo (<prosody>), wymowa (<phoneme>).
Speech Marks
Metadane synchronizacji tekstu z mowa. Zwracaja pozycje slow, zdan i visemes (ruchow ust) w czasie - przydatne do animacji lip-sync.
Lexicons
Slowniki wymowy pozwalajace dostosowac jak Polly wymawia konkretne slowa, skroty i nazwy wlasne.
Long-Form Synthesis
Asynchroniczna synteza dlugich tekstow (artykuly, ksiazki). Wynik zapisywany w S3 - bez limitu dlugosci tekstu.
Architektura: System audiobookow z Amazon Polly
Pipeline do automatycznego generowania audiobookow z tekstu z cache w CloudFront. Polly przetwarza rozdzialy asynchronicznie, generuje audio z speech marks i serwuje wyniki przez CDN z niskim latency.
Ile kosztuje Amazon Polly?
Standard Voices
Platnosc za znaki tekstu. Tansza opcja do prostych zastosowan.
$4.00 za 1 mln znakow
Neural Voices (NTTS)
Platnosc za znaki tekstu. Drozsza opcja, ale znacznie lepsza jakosc.
$16.00 za 1 mln znakow
Long-Form Voices
Glosy zoptymalizowane do dlugich tekstow (audiobooki, artykuly).
$100.00 za 1 mln znakow
Free Tier
5 mln znakow Standard i 1 mln znakow NTTS miesiecznie przez 12 miesiecy.
Wystarczy na godziny nagranego audio
Przyklady AWS CLI
Zamien tekst na mowe
Generuje plik MP3 z podanego tekstu polskim glosem
aws polly synthesize-speech \
--text "Witaj w swiecie Amazon Web Services!" \
--output-format mp3 \
--voice-id Ola \
--engine neural \
output.mp3
Uzyj SSML dla kontroli wymowy
Kontroluje pauzy i tempo mowy za pomoca SSML
aws polly synthesize-speech \
--text-type ssml \
--text "<speak>Witaj.<break time=\"1s\"/>To jest <emphasis level=\"strong\">wazna</emphasis> informacja.</speak>" \
--output-format mp3 \
--voice-id Ola \
--engine neural \
output.mp3
Lista dostepnych glosow
Wyswietla wszystkie glosy dla danego jezyka
aws polly describe-voices \
--language-code pl-PL \
--engine neural \
--query "Voices[].{Name:Name,Gender:Gender,Engine:SupportedEngines}" \
--output table
Uruchom zadanie Long-Form
Asynchroniczna synteza dlugiego tekstu z zapisem do S3
aws polly start-speech-synthesis-task \
--text "Dluga tresc artykulu..." \
--output-format mp3 \
--voice-id Ola \
--engine neural \
--output-s3-bucket-name moj-bucket \
--output-s3-key-prefix audio/
Quiz: Amazon Polly
Sprawdz czy dobrze rozumiesz podstawy. Kliknij odpowiedz — feedback pojawi sie od razu.
1. Czym roznia sie glosy Neural TTS od Standard w Polly?
2. Do czego sluzy SSML w Amazon Polly?
3. Ile znakow Neural TTS obejmuje Free Tier Polly?
Czesto uzywane razem z Amazon Polly
Chcesz poznac Amazon Polly w praktyce?
Darmowy kurs "AWS od podstaw" pokazuje jak uzywac Amazon Polly krok po kroku. Teoria + praktyka od zera.