Artikel

Xiaomi åbner OmniVoice: Flersproget tekst-til-tale AI

Xiaomi har frigivet OmniVoice som åben kildekode: en tekst-til-tale-model der kan stemmegenklone, generere flersproget tale og fungere med få data. Målet er høj intelligibilitet også for underrepræsenterede sprog.

Xiaomi åbner OmniVoice: Flersproget tekst-til-tale AI
Læsetid: 5 Minutter
Følg på Google

Stemme-AI har en tendens til at lyde imponerende på papiret og mærkeligt livløs i praksis. Xiaomi mener, at de har fundet en vej uden om det. Virksomheden har frigivet OmniVoice som åben kildekode, en ny tekst-til-tale-model bygget til stemmegenkloning, flersproget talegenerering og finmasket kontrol over, hvordan en syntetisk stemme faktisk lyder.

Hvad der gør udgivelsen bemærkelsesværdig er ikke bare den sædvanlige lovprisning om renere tale eller hurtigere output. Xiaomi præsenterer OmniVoice som en model, der kan arbejde på tværs af hundredevis af sprog, inklusive lavressourcesprog som ofte bliver ignoreret af mainstream talesystemer. Hvis det holder uden for laboratoriedemoer, kan det få betydning langt ud over flagskibstelefoner og smarte assistenter.

Annonce skete gennem Xiaomis officielle WeChat-kanal, hvor virksomheden sagde, at OmniVoice præsterer stærkt både på kinesisk og engelsk og i nogle flersprogede opgaver kan matche eller endda slå kommercielle alternativer. Det er en dristig påstand. Men detaljerne tyder på, at Xiaomi sigter mod et reelt problem i taleteknologi: de fleste tekst-til-tale-systemer fungerer stadig bedst i en håndfuld større sprog, mens alle andre får en udvandet oplevelse.

Hvor OmniVoice kan ændre samtalen

Xiaomi siger, at OmniVoice er designet med flersproget tale-syntese i kernen. Virksomheden beskriver den som en stemmegenklonings TTS-model, der understøtter hundredvis af sprog, inklusive sprog med meget begrænset træningsmateriale online. I praktiske termer betyder det, at systemet skal producere forståelig, naturligt klingende tale, selv når data er knappe, en udfordring der længe har bremset udviklingen af tale-AI for regionale og niche-sprog.

Ifølge Xiaomi overgik modellen flere kommercielle systemer i tests på tværs af 24 sprog, især i stemmesimilaritet og forståelighed, på trods af at den kun var trænet på åbne datasæt. I en bredere evaluering, der dækkede 102 sprog, siger virksomheden, at OmniVoice nåede tæt på menneskelig forståelighed og i nogle tilfælde endda overgik den. Den slags påstand fortjener naturligvis uafhængig verifikation, men det signalerer, hvor aggressivt Xiaomi ønsker at placere modellen i den globale AI-konkurrence.

Et af de mere interessante elementer i annoncen er fokuset på træning med få data. Xiaomi siger, at selv sprog med mindre end 10 timers tilgængeligt materiale stadig kan opnå høj kvalitet i talesyntese. For samfund og udviklere, der arbejder med underrepræsenterede sprog, kan det være den virkelige nyhed. En model, der sænker datakravene, ændrer, hvem der har mulighed for at bygge taleværktøjer i første omgang.

Under hjelmen tager OmniVoice en anden vej end mange af dagens mere komplekse TTS-pipelines. I stedet for at stable flere moduler og forudsigelsestrin, siger Xiaomi, at den bruger et enkelt bidirektionelt Transformer-netværk til at omsætte tekst direkte til tale. Simpel arkitektur. Færre bevægelige dele. Potentielt færre flaskehalse.

Den design er også knyttet til hastighed. Xiaomi hævder, at OmniVoice kan trænes på 100.000 timers data på én dag, og under inferens kan den køre op til 40 gange realtidshastighed i PyTorch. For udviklere betyder det noget. Hurtig inferens er ofte forskellen mellem en flot demo og noget, der faktisk kan implementeres i forbrugerprodukter, kundeservicesystemer, tilgængelighedsværktøjer eller indholdsplatforme.

Virksomheden peger på to tekniske valg bag disse gevinster. Det første er en fuld kodebogs-tilfældig-maskeringsstrategi, som siges at forbedre både effektivitet og den samlede modelpræstation under træning. Det andet er brugen af en stor sprogmodel i fortræning, et skridt Xiaomi siger hjælper med at forbedre udtale og forståelighed i en ikke-autoregressiv TTS-ramme. Med andre ord forsøger modellen ikke blot at lyde flydende; den forsøger at forstå sprogets struktur godt nok til at udtale vanskelige ord mere naturligt.

Det bliver særligt relevant i den virkelige verden, hvor talesyntese ofte bryder sammen på navne, accenter, låneord eller tekst med blandede sprog. Xiaomi siger, at OmniVoice også giver brugerne mere kontrol her. Vanskelige udtaler, herunder kinesiske polyfone tegn og engelske egennavne, kan rettes manuelt for at øge pålideligheden.

De brugerrettede funktioner er, hvor OmniVoice begynder at føles mindre som et forskningspapir og mere som en platform. Brugere kan generere tilpassede stemmer ved at beskrive træk som alder, køn, tonehøjde, accent, dialekt og talestil. Den kan også producere hviskende stemmer og andre specialiserede vokalstile uden at have brug for et reference-lydklip, hvilket er et bemærkelsesværdigt skridt i fleksibilitet.

Xiaomi siger også, at modellen kan rense støjende referenceaudio, før den kloner en stemme, og udtrække klarere talertræk fra optagelser foretaget i uperfekte omgivelser. Det lyder måske som en lille detalje, men enhver, der har arbejdet med lyd fra den virkelige verden, ved, hvor rodet kildematerialet ofte er. Et kloningssystem, der kan klare baggrundsstøj, er langt mere nyttigt end et, der kun fungerer i studiobetingelser.

Så er der udtryksmulighederne. OmniVoice understøtter intonationskontroller, inklusive effekter som latter og suk, som kan få syntetisk tale til at føles mindre mekanisk og mere samtalende. Det er den retning, markedet bevæger sig i. Næste generation af stemme-AI handler ikke kun om at læse tekst højt korrekt; det handler om performance, personlighed og følelsesmæssige nuancer.

Xiaomi er ikke den første virksomhed, der jagter det mål, og det bliver heller ikke den sidste. Men ved at frigive OmniVoice som åben kildekode satser de strategisk på, at bredere adgang for udviklere kan hjælpe med at bringe deres taleteknologi ind i flere produkter, flere markeder og flere sprog. Hvis modellen leverer bare dele af det, Xiaomi lover, kan OmniVoice blive en af årets mest interessante åbne kildekode-udgivelser inden for stemme-AI.

Maja Rasmussen

"Jeg skriver om forbrugerteknologi og tips til en smartere hverdag med digitale værktøjer."

Skriv en kommentar

Kommentarer (2)

Marius

Wow, hvis det holder uden for demoer så kan det ændre alt for små sprog! Open source er smart men jeg håber det ikke misbruges, kvalitet må være reel.

datavej

Lyder for godt til at være sandt? 102 sprog, <10 timers data... hvem tester uafhængigt, og hvad med bias og privatliv? hurtigt svar pls