Co Předčítač dělá
Předčítač vezme text, který sem vložíte, a vrátí vám soubor MP3, ve kterém je nahlas přečtený. Teď je tu 32 českých hlasů, hlasy rodilých mluvčích pro dalších 63 jazyků a možnost udělat si vlastní hlas z nahrávky dlouhé tři až osm sekund.
Navíc umí doplnit chybějící diakritiku. To není ozdoba: stejná věta napsaná s háčky a bez nich vyjde po přečtení jinak — změřeno 0,991 proti 0,854, a „Škola začíná v září“ zní bez háčků jako „Z kolázaci navzary“.
Jeden požadavek může mít až 500 slov, mezi dvěma je 5 sekund pauza. Není tu placený tarif, není co vylepšovat a soubor nemá žádný vodoznak.
Odkud hlasy pocházejí
Všechny z Mozilla Common Voice 17.0 — otevřeného korpusu, kde lidé z celého světa čtou věty a navzájem si je kontrolují. Každá nahrávka nese client_id, tedy kód toho, kdo ji pořídil. Díky tomu s jistotou víme, že každý hlas je jiný člověk, a ne týž člověk dvakrát.
Z toho jsme vybrali 32 — 16 ženských a 16 mužských. Od každého člověka jeho nejčistší nahrávku, měřenou poměrem hlasu k šumu.
Každý hlas musel projít dvěma kontrolami, než se sem dostal. Za prvé: rozpoznávač řeči musel z předem známé české věty správně přečíst víc než 55 % slov. Za druhé: stroj musel reprodukovat skutečnou výšku hlasu toho člověka. Hlasy, které se odchýlily o víc než 40 Hz nebo přeskočily na druhou stranu hranice mezi ženským a mužským rejstříkem, jsme vyřadili — jinak byste dostali něco jiného, než jste si poslechli.
Proč tu není výběr nářečí
Protože na něj nejsou data, a je poctivější to říct než vyrobit pět nálepek. Common Voice má sloupec, kam přispěvatel sám napíše, jakým nářečím mluví. U češtiny ho nechalo prázdné 358 z 405 lidí, kteří mají dost čistých nahrávek. Devět lidí napsalo „Moravský“, tři něco z Ostravska nebo Slezska, a zbytek jsou jednotlivé formulace jako „Pražák“, „spisovny“ nebo „Typical“.
V katalánské verzi tohohle projektu to pole vyplnilo dost lidí na to, aby se daly postavit hlasy pěti nářečí, a je to hlavní věc, kterou ta stránka nabízí. U češtiny by z devíti lidí vzniklo pět kategorií, ve kterých by byl jeden dva hlasy — a nikdo by z toho nic neměl. Tahle stránka proto nabízí něco jiného: doplňování diakritiky, které se u češtiny změřit dá.
Proč nepoužíváme studiové korpusy, které existují
Je to správná otázka, protože pro češtinu nějaké jsou. Prošli jsme je jeden po druhém a vyřadili, a stojí za to říct proč.
VoxPopuli má 62 hodin českých projevů z jednání Evropského parlamentu, nahraných v dobré kvalitě. Jenže je pod CC BY‑NC: jen nekomerční užití. Tahle stránka nevybírá peníze, ale MP3, které si odsud stáhnete, používáte vy — a část z vás ho použije v práci. Postavit veřejný nástroj na korpusu, který komerční užití zakazuje, znamená přenést ten problém na uživatele a mlčet o tom.
Český telefonní korpus je pod CC BY‑SA, tedy ShareAlike. To není etický problém, ale přeneslo by to podmínky na každého, kdo si odsud stáhne soubor — a celá tahle řada projektů vznikla právě proto, aby žádné podmínky nepřenášela.
Common Voice je CC0 1.0 — vzdání se práv, ne licence s podmínkami — a nahrávky poskytli lidé, kteří věděli, že jdou do otevřeného korpusu. Cena za to je, že jsou domácí, ne studiové. Tuhle cenu radši zaplatíme my, než abychom ji nechali platit někoho jiného.
Odkud je tabulka pro doplňování diakritiky
Tabulka má 63 343 hesel a vznikla z frekvenčního seznamu českých slov (hermitdave/FrequencyWords, licence MIT, postaveno na OpenSubtitles projektu OPUS). Ke každému tvaru bez diakritiky se podívá, jaké tvary s diakritikou existují a jak jsou časté.
Heslo se do tabulky dostane jen tehdy, když nejčastější tvar s diakritikou osmkrát převyšuje druhý v pořadí a třicetkrát tvar bez diakritiky. Proto tam „byt“ není: „být“ je sice častější, ale ne natolik, aby se dalo hádat. Obě ta čísla nejsou odhad — projeli jsme celou mřížku možností a vybrali podle křivky užitku a škody.
Měřeno na 14 899 českých větách z Common Voice, u kterých známe správnou odpověď: 76,0 % slov, která diakritiku potřebují, se doplní správně; 0,4 % všech slov se změní špatně. Podíl správně napsaných slov tím stoupne ze 48,8 % na 87,7 %.
Jak vzniká zvuk
Hlas se neskládá z předem nahraných kousků. Každou větu vytvoří model na grafické kartě ve chvíli, kdy zmáčknete tlačítko. Změřeno na stroji, který to dělá: text o 500 slovech trvá asi 17 sekund.
Celý web běží na jediné grafické kartě, sdílené s další prací. Když je obsazená, stránka to řekne hned a napíše, kolik sekund počkat — místo aby vás nechala čekat a pak selhala.
Proč je to zdarma
Předčítač je osobní projekt, který spravuje jeden člověk. Není to firma ani zapsaná obchodní společnost. Stroj, který hlasy vytváří, existoval už kvůli něčemu jinému, a hodiny, které mu zbývají, pohánějí tuhle stránku. Nejsou tu reklamy, není tu sledování a data se neprodávají: není co prodávat, protože nechceme ani e‑mailovou adresu.
Limity tu nejsou proto, aby vás tlačily k placenému tarifu, který neexistuje. Jsou tu proto, aby jedna grafická karta stihla obsloužit hodně lidí najednou.
Co ještě neumí
Hlasy nejsou studiové. Common Voice se nahrává doma, na mikrofon, který kdo má. Od každého člověka jsme vybrali tu nejčistší nahrávku, ale kvalita to není jako u placeného reklamního hlasu.
Doplňování diakritiky nedoplní koncovky. „Rovne“ může být rovné i rovně, „pristavu“ přístavu i přístavů — na to je potřeba věta, ne slovo. Tabulka proto raději vynechá, než by hádala.
Z 646 jazyků, které model zná, má hlas rodilého mluvčího jen 63. Zbytek se přečte s českým přízvukem, a nástroj to řekne dřív, než o to požádáte.
Není tu veřejné API, nejsou tu účty a není tu historie vytvořených souborů.
Kdo za tím stojí
Předčítač je osobní projekt, který spravuje jeden člověk. Není to firma ani zapsaná obchodní společnost.
Píše se na [email protected]. Je to jediná cesta — víc otevřených kanálů u projektu, který spravuje jeden člověk, znamená jen víc kanálů, kde nikdo neodpovídá.