EM POUCAS LINHAS
- A classificação padrão do ranking usa avaliações em inglês, não uma nota demonstrada para português brasileiro.
- Erros de transcrição, similaridade de locutor e latência respondem a perguntas diferentes da preferência de ouvintes.
- A alegação da Google sobre português brasileiro se refere à Voice Arena; não é resultado do Open TTS Leaderboard.
- Modelos ausentes do ranking podem ser avaliados com critérios semelhantes, mas não recebem uma posição comparável sem o mesmo protocolo.
O novo ranking ajuda a formular perguntas melhores sobre síntese de voz, mas não oferece, por si só, uma resposta definitiva sobre a melhor ferramenta para português brasileiro. O Open TTS Leaderboard foi anunciado em 30 de setembro de 2026 com foco em modelos de texto para fala (TTS) de código aberto e em avaliação multilíngue. Seu mérito é separar aspectos que uma posição única tende a misturar: fidelidade ao texto, preservação da voz de referência e rapidez. A ressalva decisiva é que resultados de um idioma, de um conjunto de frases ou de um equipamento não se transferem automaticamente para outro contexto.
O que o ranking efetivamente compara
Segundo a descrição dos responsáveis pelo ranking, a inteligibilidade é estimada comparando o texto solicitado com a transcrição do áudio gerado por um sistema de reconhecimento de fala, o Qwen3 ASR. As medidas são taxa de erro por palavra (WER) ou por caractere (CER). Uma taxa menor sugere que a transcrição ficou mais próxima do texto pedido, mas o resultado também depende do reconhecimento automático: ele é um indicador indireto, não uma escuta humana capaz de julgar entonação ou conforto auditivo.
O ranking também mede velocidade por RTFx, usado para inferência em lote em uma GPU H200, e por tempo até o primeiro áudio (TTFA) para geração interativa em GPU H200 ou CPU. Para modelos com clonagem de voz, calcula similaridade (SIM) entre representações da voz gerada e do áudio de referência, conforme a metodologia apresentada pelos autores. Essa similaridade trata de identidade vocal, não de autorização para replicar a voz de alguém. Um sistema pode conservar características do locutor e ainda soar pouco natural; outro pode soar agradável, mas omitir palavras ou demorar a começar.
Há ainda uma diferença importante entre velocidade e qualidade percebida: uma resposta que começa cedo pode ser útil em uma conversa, enquanto a constância da voz e a pronúncia ao longo de um conteúdo extenso podem pesar mais em uma narração. Os autores afirmam expressamente que WER baseado em reconhecimento de fala e similaridade de locutor não medem diretamente naturalidade, expressividade ou preferência dos ouvintes. Portanto, as colunas não devem ser somadas informalmente como se produzissem uma nota universal de qualidade.
Por que a nota padrão não resolve o caso brasileiro
Na visualização padrão, os modelos são classificados pela média macro de WER nas divisões em inglês de Seed TTS Eval e CV3 Eval, segundo o anúncio do leaderboard. Os responsáveis permitem selecionar outros idiomas e explicam que, fora de inglês e chinês, os resultados usam CV3 Eval; o texto do anúncio, porém, não enumera todos os idiomas selecionáveis nem comprova nele uma divisão específica de português brasileiro. Sem conferir um resultado nesse idioma e seu conjunto de avaliação, não é correto transformar a posição padrão em desempenho brasileiro.
O recorte de latência é igualmente específico. Na aba de streaming, o protocolo descrito usa 50 frases em inglês do CV3 Eval, uma geração por vez, o mesmo equipamento e a voz padrão de cada modelo; descarta as primeiras três execuções e informa a mediana do TTFA nas demais. Para um modelo que não transmite áudio progressivamente, o tempo conta até a fala inteira ficar pronta. Esse teste ajuda a comparar configurações submetidas àquele procedimento, mas não demonstra a espera de um usuário brasileiro com frases em português, outra voz ou uma infraestrutura de produção diferente.
O próprio ranking oferece uma aba para ouvir saídas e compará-las, de acordo com seus criadores. Ouvir o material pode revelar diferenças que uma taxa de erro não captura; ainda assim, a escolha deve considerar a tarefa e o idioma do projeto, não apenas exemplos agradáveis. Para entender por que condições de execução importam em qualquer classificação, vale também o guia do acervo sobre como interpretar benchmarks de IA.
Voice Arena e Open TTS Leaderboard não são o mesmo teste
A Google anunciou Gemini 3.8 Flash TTS e Flash-Lite TTS em 23 de setembro de 2026, antes do lançamento do novo leaderboard. No mesmo anúncio, a empresa afirma que os modelos obtiveram posições de destaque em avaliações cegas de preferência humana na Voice Arena, incluindo português brasileiro. Essa é uma alegação da fabricante sobre outra avaliação; a página não fornece, nesse trecho, uma nota brasileira para o Open TTS Leaderboard, nem estabelece a participação dos modelos nele. Não se deve converter preferência humana relatada numa arena em WER, TTFA ou colocação em outro ranking.
A distinção se estende ao produto. A Google descreve direcionamento de sotaque e interpretação, criação de vozes e replicação condicionada à verificação de consentimento; são características declaradas do serviço, não resultados medidos pelo Open TTS Leaderboard. A empresa anunciou início da disponibilização dos modelos na Gemini API e no Google AI Studio naquela data e indicou acesso empresarial via API no Gemini Enterprise como futuro. Anúncio e início de disponibilização não comprovam, isoladamente, acesso efetivo, condições comerciais ou adequação ao Brasil.
Como avaliar uma opção que não aparece na tabela
Sim: os critérios do ranking servem como roteiro para examinar ferramentas ausentes, mas não autorizam atribuir-lhes uma posição no leaderboard. Exemplo hipotético: uma equipe que produz atendimento falado em português brasileiro poderia preparar frases com nomes, siglas, números e variações de pronúncia relevantes ao seu próprio serviço. Ela compararia o texto original com transcrições dos áudios, ouviria amostras para identificar pausas e entonação e mediria a demora até o primeiro som na configuração de uso pretendida. Se houver voz de referência, avaliaria separadamente consistência vocal e autorização para utilizá-la.
Para uma comparação direta com resultados publicados, seria necessário reproduzir os mesmos dados, parâmetros e condições de execução; não basta adotar os nomes das métricas. Os autores do Open TTS Leaderboard dizem que pretendem publicar seus scripts de avaliação futuramente, o que não equivale a confirmar sua disponibilidade no material examinado. Uma avaliação própria, mesmo útil para decidir uma compra ou integração, responderia à necessidade daquela equipe, não recalcularia automaticamente o ranking.
A resposta prática, portanto, é dupla: use o leaderboard para identificar modelos e compromissos entre fidelidade, velocidade e similaridade sob o protocolo publicado; para português brasileiro, peça evidências no idioma e ouça saídas adequadas à tarefa. Para modelos não listados, resultados da Voice Arena ou promessas de produto podem acrescentar contexto, mas continuam sendo evidências de natureza diferente. Participação no novo ranking, cobertura efetiva de português brasileiro em suas divisões e condições de uso no Brasil permanecem pontos a confirmar, não lacunas a preencher com a classificação em inglês.
Fontes e referências
- Open TTS Leaderboard: Scalable Evaluation for Multilingual Text-to-Speech and Voice CloningHugging Face Blog · Consultado em 01/10/2026
- Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTSGoogle DeepMind · Consultado em 01/10/2026