Google je 24. septembra 2026. predstavio dva nova modela za pretvaranje teksta u govor — Gemini 3.8 Flash TTS i Gemini 3.8 Flash-Lite TTS — sa preko 2.000 gotovih glasova na više od 100 jezika i ugrađenim mehanizmima protiv zloupotrebe kloniranja glasa. Novi modeli zamenjuju dosadašnje fiksne kataloge glasova fleksibilnijim sistemom u kojem se ton, tempo i “ličnost” glasa mogu opisati običnim tekstualnim uputstvom, umesto biranja sa unapred ograničene liste.
Najvažnije
- Google je predstavio dva TTS modela: Gemini 3.8 Flash TTS za kreativne projekte i Flash-Lite TTS za dabing i chatbotove.
- Dostupno je preko 2.000 unapred napravljenih glasova na više od 100 jezika, uključujući regionalne varijante.
- Modeli podržavaju dijaloge sa više govornika uz prirodno smenjivanje replika.
- U tekst je moguće ubaciti zvučne oznake poput smeha, uzdaha ili pauze, koje model pretvara u odgovarajući zvuk.
- Kloniranje glasa zahteva 30-sekundni uzorak i eksplicitnu usmenu saglasnost vlasnika glasa, a svaki generisani fajl nosi SynthID vodeni žig.
- Modeli su dostupni preko Google AI Studio i Gemini API-ja, uz rane partnere kao što su Figma, HeyGen i Wondercraft.
Šta tačno mogu ova dva modela
Gemini 3.8 Flash TTS je zamišljen za zahtevnije kreativne zadatke — pisanje scenarija, razvoj video igara i dugačku naraciju, gde je važno da glas ima prepoznatljiv karakter i emocionalnu nijansu. Flash-Lite verzija je, s druge strane, optimizovana za zadatke velikog obima: automatizovani dabing filmova i serija, konverzacione AI agente i masovne prevode sadržaja na desetine jezika odjednom. Oba modela dele istu biblioteku od preko 2.000 glasova, ali se razlikuju po brzini i ceni obrade, što developerima daje izbor između kvaliteta i troška u zavisnosti od projekta.
Posebno zanimljiva mogućnost je generisanje dijaloga sa više govornika u jednom prolazu — model može da simulira prirodan razgovor dve ili više osoba, uz pauze, upadanje u reč i promene intonacije, umesto da se svaka replika generiše posebno pa naknadno ručno spaja u alatu za montažu zvuka. Uz to, autori teksta mogu direktno u scenario da ubace oznake u uglastim zagradama poput oznake za smeh ili uzdah, a model će te oznake pretvoriti u odgovarajući zvučni izraz umesto da ih pročita naglas kao tekst. Najavljen je i poseban modul za naknadno “remiksovanje” glasa koji bi trebalo da omogući podešavanje boje glasa, visine tona, tempa i akcenta na već snimljenom materijalu, iako taj deo funkcionalnosti za sada nije dostupan svim korisnicima.
Bezbednost i kloniranje glasa — šta Google kaže
Mogućnost kloniranja tuđeg glasa nosi očigledan rizik zloupotrebe, od lažnih audio poruka do telefonskih prevara, pa je Google u ovu generaciju modela ugradio nekoliko zaštitnih slojeva. Za kloniranje glasa potreban je najmanje 30-sekundni referentni snimak, a sistem dodatno traži eksplicitnu usmenu saglasnost osobe čiji se glas klonira, pre nego što model uopšte može da generiše novi sadržaj tim glasom. Svaki fajl koji izađe iz modela nosi i nevidljivi SynthID audio vodeni žig, zajedno sa kriptografskim metapodacima koje specijalizovani alati mogu da pročitaju i potvrde da je snimak veštački generisan. Ovo ne rešava problem zloupotrebe u potpunosti — tehnički potkovan korisnik teorijski i dalje može pokušati da zaobiđe pojedine provere — ali podiže prag za masovnu, automatizovanu zloupotrebu i olakšava naknadnu detekciju lažnih snimaka platformama i istraživačima.
Kako se modeli pokazuju na testovima
Prema nezavisnim merenjima na Hume AI benčmarku, Flash TTS je ostvario ukupan skor od 71,4 poena, sa posebno jakim rezultatom od 60,8 poena u modelovanju akcenata — kategoriji u kojoj su prethodne generacije glasovnih modela tradicionalno bile slabije. Oba nova modela nadmašila su prethodnu generaciju Gemini 3.1 na istim testovima, što Google predstavlja kao dokaz da je razlika između sintetičkog i ljudskog glasa sve teže uočljiva, barem u kontrolisanim uslovima testiranja. Za komercijalne korisnike ovakvi benčmarkovi su relevantni prvenstveno kao orijentir, a stvarni kvalitet za konkretan jezik i akcenat i dalje najbolje proverava sopstvenim testom pre nego što se model uvede u produkciju.
Šta ovo znači za kreatore sadržaja na Balkanu
Za domaće kreatore sadržaja, podkastere i male studije za produkciju videa, jeftiniji i fleksibilniji TTS otvara praktična vrata: narisanje teksta za YouTube video, audio-verzija članaka na sajtu radi pristupačnosti, ili brzo pravljenje probnih (draft) glasovnih zapisa pre nego što se angažuje profesionalni spiker za finalnu verziju. Google u najavi navodi da modeli pokrivaju preko 100 jezika i regionalnih varijanti, ali zvanična najava ne ističe posebno da li je srpski jezik među podržanim — ko planira da ga koristi za sadržaj na srpskom, najbolje je da prvo proveri aktuelnu listu podržanih jezika direktno u Google AI Studio pre nego što gradi ceo proizvod oko te pretpostavke. Za firme koje rade dabing ili lokalizaciju sadržaja za regionalno tržište, Flash-Lite verzija bi mogla vremenom da ubrza i pojeftini proces, pod uslovom da kvalitet izgovora na manje zastupljenim jezicima zaista bude na nivou onoga što Google obećava u najavi.
Kako se Google pozicionira u odnosu na konkurenciju
Google nije jedina velika kompanija koja trenutno ulaže u realistične AI glasove — OpenAI i specijalizovane firme poput ElevenLabs takođe razvijaju sopstvene modele za generisanje govora, a konkurencija na ovom tržištu poslednjih meseci vidno raste, delom i zbog sve veće potražnje za jeftinom lokalizacijom video sadržaja i automatizovanim korisničkim servisom. Ono što Google ističe kao svoju prednost jeste kombinacija širine ponude — preko 2.000 glasova na više od 100 jezika u jednom paketu — i direktne integracije sa ostatkom Gemini ekosistema, od API-ja do alata za razvoj aplikacija poput Vercel-a. Za firme koje već koriste Google-ove servise, ovo može značiti jednostavniju implementaciju u odnosu na spajanje alata više različitih dobavljača, iako to samo po sebi ne garantuje bolji kvalitet zvuka za svaki pojedinačni jezik ili akcenat.
Pitanja i odgovori
Šta je Gemini 3.8 Flash TTS?
To je AI model kompanije Google koji tekst pretvara u govor koristeći više od 2.000 unapred napravljenih glasova, uz mogućnost opisivanja željenog tona i stila putem teksta, umesto biranja sa fiksne liste glasova kao ranije.
Da li je kloniranje glasa preko ovog alata bezbedno?
Google je uveo dodatne provere — obavezan referentni snimak i usmenu saglasnost vlasnika glasa, kao i nevidljivi SynthID vodeni žig u svakom generisanom fajlu — što otežava, ali ne isključuje potpuno, moguću zloupotrebu.
Gde mogu da isprobam ove glasovne modele?
Modeli su dostupni preko Google AI Studio i standardnog Gemini API-ja, kao i kroz integracije sa platformama poput Agora, LiveKit, Pipecat i Vercel, uz rane komercijalne partnere poput Figme, HeyGen-a i Wondercraft-a.
Povezani članci
- Gemini vodič 2026: model, planovi (Free, AI Pro, AI Ultra) i kako da počneš
- ChatGPT na mobilnom dobija glasovne AI agente
- Baza AI alata 2026: cene, besplatni planovi i poređenje
Izvor: AI News (artificialintelligence-news.com)
