Amazon Polly
AI/ML Cloud Practitioner Solutions Architect Associate Machine Learning Specialty

Amazon Polly

Amazon Polly

Serwis text-to-speech zamieniajacy tekst w naturalna mowe. Glosy neuralne (NTTS) w ponad 30 jezykach - od audiobookow po asystentow glosowych.

Amazon Polly to serwis text-to-speech (TTS), ktory zamienia tekst w naturalna mowe ludzka. Wykorzystuje technologie deep learning do generowania glosow, ktore brzmia realistycznie i naturalnie. Polly obsluguje ponad 30 jezykow (w tym polski!) i oferuje dziesiatki roznych glosow.

Polly oferuje dwa typy glosow: Standard (klasyczna synteza) i Neural TTS (NTTS), ktory brzmi znacznie bardziej naturalnie. Dzieki SSML mozesz precyzyjnie kontrolowac wymowe, pauzy, intonacje i tempo mowy.

Czy wiesz, ze...

Amazon Polly obsluguje polskie glosy neuralne - Ola (kobiecy) i Jacek (meski). Speech Marks pozwalaja synchronizowac ruchy ust postaci animowanej z generowana mowa (lip-sync), co jest wykorzystywane w grach i aplikacjach VR.

Pro Tip

Uzyj SSML do poprawy jakosci wymowy nazw wlasnych i skrotow. Tag pozwala podac dokladna wymowe w formacie IPA. Dla dlugich tekstow (artykuly, ksiazki) uzyj StartSpeechSynthesisTask - wynik trafi do S3 bez timeoutu.

Polly zamienia tekst na naturalna mowe (text-to-speech) uzywajac modeli deep learning. Obsuguje dziesiatki jezykow i glosow, w tym zaawansowane glosy neuralne, ktore sa niemal nieodroznialne od ludzkiej mowy.

1

Przygotowanie tekstu wejsciowego

Tekst przekazujesz jako plain text lub SSML (Speech Synthesis Markup Language). Plain text jest prostszy, ale SSML daje kontrole nad wymowa, pauzami, intonacja i szybkoscia. Polly obsluguje do 3000 znakow na jedno wywolanie SynthesizeSpeech lub do 200,000 znakow dla asynchronicznych zadan (StartSpeechSynthesisTask).

2

Wybor glosu i silnika

Polly oferuje trzy silniki: Standard (najstarszy, najtanszy), Neural (naturalny, realistyczny) i Long-Form (zoptymalizowany dla dlugich tekstow jak audiobooki). Kazdy jezyk ma kilka glosow do wyboru. Dla polskiego dostepne sa glosy standardowe (Ewa, Maja, Jacek, Jan) oraz neuralny Ola. Neural brzmi znacznie bardziej naturalnie, ale kosztuje wiecej.

3

Synteza mowy

SynthesizeSpeech to synchroniczne API zwracajace strumien audio. Wynik moze byc w formacie MP3, OGG Vorbis lub PCM. Dla dlugich tekstow (powyzej 3000 znakow) uzyj StartSpeechSynthesisTask - Polly przetwarza tekst asynchronicznie i zapisuje wynik do S3. Otrzymujesz URL do pliku audio po zakonczeniu.

4

Leksykony wymowy

Leksykony (Lexicons) pozwalaja definiowac wlasna wymowe dla slow specyficznych: nazw wlasnych, akronimow, terminow branzkowych. Tworzysz leksykon w formacie PLS (Pronunciation Lexicon Specification) i dolaczasz go do zadania syntezy. Mozesz miec do 5 leksykonow na jedno wywolanie. Leksykon nadpisuje domyslna wymowe.

5

Znaczniki mowy (Speech Marks)

Polly moze generowac speech marks - metadane synchronizujace tekst z audio. Typy: sentence (poczatek zdania), word (poczatek slowa), viseme (ruchy ust), SSML (tagi SSML). Speech marks zwracane sa jako JSON z timestampami w milisekundach. Umozliwiaja karaoke-style highlighting tekstu i animacje ust postaci.

6

Real-time streaming

Polly obsluguje streaming audio - zaczyna odtwarzanie zanim caly tekst zostanie przetworzony. Uzywasz HTTP/2 streaming z SynthesizeSpeech i OutputFormat=pcm lub mp3. Latency dla pierwszego bajtu to ok. 200-500ms. Streaming jest kluczowy dla IVR (Interactive Voice Response) i asystentow glosowych, gdzie opoznienie jest krytyczne.

Polly daje dobre wyniki od razu, ale optymalizacja wymowy, kosztow i integracji wymaga doswiadczenia. Ponizsze wskazowki pomoga wyciagnac maksimum z text-to-speech.

SSML dla kontroli nad wymowa

Uzywaj tagow SSML: <break> dla pauz (np. <break time="500ms"/>), <emphasis> dla akcentow, <prosody> dla szybkosci i glosnosci, <phoneme> dla dokladnej wymowy trudnych slow, <say-as> dla dat, liczb, akronimow. SSML jest niezbedny dla profesjonalnych zastosowan - plain text czesto zle wymawia nazwy wlasne i skroty.

Poczatkujacy

Neural vs Long-Form - wybierz odpowiedni silnik

Neural daje najlepsza jakosc dla krotkich tekstow (powiadomienia, komunikaty IVR, opisy produktow). Long-Form jest zoptymalizowany dla dlugich tresci (artykuly, audiobooki, raporty) - ma lepszy rhythm i intonacje na przestrzeni wielu akapitow. Standard uzywaj tylko jezeli budzet jest krytyczny lub potrzebujesz glosu niedostepnego w Neural.

Poczatkujacy

Cache audio w S3 lub CloudFront

Polly kosztuje $16/milion znakow (Neural) lub $100/milion (Long-Form). Jezeli generujesz audio dla tych samych tekstow wielokrotnie, cache wyniki. Hashuj tekst + glos + parametry, sprawdzaj cache przed wywolaniem Polly. Dla statycznych tresci (opisy produktow, komunikaty) generuj audio raz i serwuj z CloudFront.

Zaawansowany

Leksykony dla terminologii branzkowej

Polly moze zle wymawiac nazwy wlasne, akronimy i terminy techniczne. Stworz leksykon PLS z poprawna wymowa. Przyklad: slowo "AWS" czytane jako "A W S", nie "aws". Leksykony sa per-region - jezeli uzywasz Polly w wielu regionach, wgraj leksykon do kazdego. Testuj wymowe iteracyjnie - uzywaj tagu <phoneme alphabet="ipa"> dla precyzyjnej kontroli.

Zaawansowany

Dziel dlugie teksty na segmenty

SynthesizeSpeech ma limit 3000 znakow. Dla dluzszych tekstow uzyj StartSpeechSynthesisTask (do 200,000 znakow) lub podziel tekst na akapity. Dziel na naturalnych granicach (koniec zdania, akapit), nie w srodku zdania. Lacz segmenty audio narzedziem ffmpeg z crossfade 50ms dla plynnego przejscia.

Poczatkujacy

Speech marks do synchronizacji tekstu

Generuj speech marks (OutputFormat=json z SpeechMarkTypes=word,sentence) rownolegle z audio. Uzywaj ich do: podswietlania czytanego tekstu w UI (e-learning), animacji ust postaci (viseme marks), nawigacji w dlugim audio (sentence marks). Speech marks sa darmowe - nie doliczaja sie do limitu znakow.

Zaawansowany

Screenshoty z AWS Console

Wkrotce pojawia sie tu zrzuty ekranu pokazujace jak korzystac z Amazon Polly bezposrednio w konsoli AWS.

Do czego sluzy Amazon Polly?

01

Audiobooki i e-learning

Automatycznie generuj nagrania audio z artykulow, kursow i dokumentacji. Idealne do tworzenia podcastow i materialow szkoleniowych.

02

Asystenci glosowi i IVR

Dodaj naturalny glos do chatbotow (Lex), systemow telefonicznych (Connect) i asystentow glosowych w aplikacjach.

03

Dostepnosc (accessibility)

Udostepnij tresc tekstowa osobom niewidomym i slabowidzacym. Generuj wersje audio stron internetowych.

04

Powiadomienia glosowe

Generuj dynamiczne komunikaty glosowe dla systemow IoT, alertow, nawigacji i aplikacji mobilnych.

Co musisz wiedziec?

Neural TTS (NTTS)

Zaawansowane glosy oparte na deep learning, ktore brzmia prawie jak prawdziwy czlowiek. Znacznie lepsza jakosc niz Standard, ale drozsze.

Standard Voices

Klasyczne glosy oparte na concatenative synthesis. Tansze, ale brzmia mniej naturalnie. Nadal dobre do prostych zastosowan.

SSML (Speech Synthesis Markup Language)

Jezyk znacznikow do kontroli wymowy: pauzy (<break>), emfaza (<emphasis>), tempo (<prosody>), wymowa (<phoneme>).

Speech Marks

Metadane synchronizacji tekstu z mowa. Zwracaja pozycje slow, zdan i visemes (ruchow ust) w czasie - przydatne do animacji lip-sync.

Lexicons

Slowniki wymowy pozwalajace dostosowac jak Polly wymawia konkretne slowa, skroty i nazwy wlasne.

Long-Form Synthesis

Asynchroniczna synteza dlugich tekstow (artykuly, ksiazki). Wynik zapisywany w S3 - bez limitu dlugosci tekstu.

Architektura: System audiobookow z Amazon Polly

Pipeline do automatycznego generowania audiobookow z tekstu z cache w CloudFront. Polly przetwarza rozdzialy asynchronicznie, generuje audio z speech marks i serwuje wyniki przez CDN z niskim latency.

CMS / Redakcja Tekst artykulu lub rozdzialu z metadanymi SSML
SSML text
AWS Lambda
AWS Lambda Podział tekstu na segmenty, dodanie SSML, wywolanie Polly
SynthesisTask
Amazon Polly
Amazon Polly Synteza Long-Form Neural z speech marks i leksykonami
MP3 + JSON
Amazon S3
Amazon S3 Przechowywanie plikow MP3 i JSON speech marks
Signed URL
Amazon CloudFront
Amazon CloudFront CDN z signed URLs dla autoryzowanego dostepu do audio
Stream MP3
Aplikacja klienta Player z podswietlaniem tekstu synchronizowanym przez speech marks
Uzyj StartSpeechSynthesisTask zamiast SynthesizeSpeech dla rozdzialow dluzszych niz 3000 znakow - task zapisuje wynik bezposrednio do S3 i obsluguje do 200,000 znakow.
Wdraz leksykony specyficzne dla tematyki (np. terminologia medyczna, nazwy wlasne) aby poprawic jakosc wymowy specjalistycznych tekstow.
Generuj speech marks rownolegle z audio - pozwalaja na synchronizacje tekstu z dzwiekiem w playerze bez dodatkowych kosztow.

Ile kosztuje Amazon Polly?

Standard Voices

Platnosc za znaki tekstu. Tansza opcja do prostych zastosowan.

$4.00 za 1 mln znakow

Neural Voices (NTTS)

Platnosc za znaki tekstu. Drozsza opcja, ale znacznie lepsza jakosc.

$16.00 za 1 mln znakow

Long-Form Voices

Glosy zoptymalizowane do dlugich tekstow (audiobooki, artykuly).

$100.00 za 1 mln znakow

Free Tier

5 mln znakow Standard i 1 mln znakow NTTS miesiecznie przez 12 miesiecy.

Wystarczy na godziny nagranego audio

Przyklady AWS CLI

Zamien tekst na mowe

Generuje plik MP3 z podanego tekstu polskim glosem

aws polly synthesize-speech \
 --text "Witaj w swiecie Amazon Web Services!" \
 --output-format mp3 \
 --voice-id Ola \
 --engine neural \
  output.mp3

Uzyj SSML dla kontroli wymowy

Kontroluje pauzy i tempo mowy za pomoca SSML

aws polly synthesize-speech \
 --text-type ssml \
 --text "<speak>Witaj.<break time=\"1s\"/>To jest <emphasis level=\"strong\">wazna</emphasis> informacja.</speak>" \
 --output-format mp3 \
 --voice-id Ola \
 --engine neural \
  output.mp3

Lista dostepnych glosow

Wyswietla wszystkie glosy dla danego jezyka

aws polly describe-voices \
 --language-code pl-PL \
 --engine neural \
 --query "Voices[].{Name:Name,Gender:Gender,Engine:SupportedEngines}" \
 --output table

Uruchom zadanie Long-Form

Asynchroniczna synteza dlugiego tekstu z zapisem do S3

aws polly start-speech-synthesis-task \
 --text "Dluga tresc artykulu..." \
 --output-format mp3 \
 --voice-id Ola \
 --engine neural \
 --output-s3-bucket-name moj-bucket \
 --output-s3-key-prefix audio/

Quiz: Amazon Polly

Sprawdz czy dobrze rozumiesz podstawy. Kliknij odpowiedz — feedback pojawi sie od razu.

Twoj wynik: 0 / 3

1. Czym roznia sie glosy Neural TTS od Standard w Polly?

2. Do czego sluzy SSML w Amazon Polly?

3. Ile znakow Neural TTS obejmuje Free Tier Polly?

Chcesz poznac Amazon Polly w praktyce?

Darmowy kurs "AWS od podstaw" pokazuje jak uzywac Amazon Polly krok po kroku. Teoria + praktyka od zera.

Zacznij darmowy kurs Wszystkie serwisy