ElevenLabs apresenta modelos de voz v4 com clonagem de voz mais rápida e suporte a mais idiomas
A ElevenLabs lançou dois novos modelos de voz na segunda-feira: ElevenLabs v4 e v4 Turbo. Os modelos oferecem maior controle sobre a expressão vocal, menor latência para agentes de voz e suporte a mais de 90 idiomas.
Nova arquitetura e clonagem de voz mais rápida
Após lançar seu modelo v3 no ano passado e apresentar uma prévia de seu sucessor em um evento em Varsóvia no início deste ano, a ElevenLabs introduziu uma nova arquitetura para a geração v4. O design atualizado oferece um controle mais preciso e uma clonagem de voz mais rápida, permitindo que os usuários repliquem uma voz usando apenas 10 segundos de áudio.
Expressividade e compreensão de contexto aprimoradas
Para aplicações criativas, o v4 preserva a identidade da voz de forma mais consistente em trechos mais longos. Ele também considera o contexto textual durante a leitura em voz alta, permitindo mudanças de expressão mais adequadas.
A ElevenLabs introduziu tags de expressão integradas ao texto com o v3. No v4, esse recurso foi expandido para que os usuários possam combinar várias tags, com o modelo seguindo-as em sequência.
Suporte a mais de 90 idiomas
O modelo anterior oferecia suporte a 70 idiomas, enquanto o v4 amplia essa cobertura para mais de 90. Segundo a ElevenLabs, as maiores melhorias de qualidade foram observadas em japonês, português do Brasil, mandarim e cantonês.
Menor latência para agentes de voz corporativos
A ElevenLabs expandiu rapidamente seu negócio de chamadas corporativas ao longo do último ano, e as grandes empresas agora representam mais de 55% de seus negócios. A empresa afirma que o v4 é particularmente adequado para agentes de voz, pois sua menor latência permite conversas mais fluidas e naturais.
O modelo pode começar a produzir áudio assim que o modelo de linguagem de grande porte subjacente começa a gerar uma resposta. Ele também pode reagir de maneiras diferentes a confrontos, escalonamentos e esperas, contribuindo para uma resolução de problemas mais eficaz.
Concorrência crescente em IA de voz
A concorrência no mercado de modelos de voz se intensificou à medida que startups como Cartesia, Deepgram, Fish Audio, Boson e WellSaid Labs desenvolvem sistemas cada vez mais expressivos. Grandes empresas de tecnologia, como Google e OpenAI, também continuam aprimorando seus modelos de voz.
Financiamento, crescimento da receita e expansão
No início deste ano, a ElevenLabs captou US$ 500 milhões em uma rodada de financiamento liderada pela Sequoia, que avaliou a empresa em US$ 11 bilhões. Desde então, surgiram rumores sobre uma nova rodada que poderia dobrar sua avaliação para US$ 22 bilhões.
A receita anualizada da empresa subiu de aproximadamente US$ 330 milhões no início do ano para mais de US$ 600 milhões. A ElevenLabs também realizou contratações em ritmo acelerado em mercados como Índia, Europa e Brasil, elevando seu quadro de funcionários para mais de 800 pessoas.
Possíveis planos de abertura de capital
O cofundador e CEO Mati Staniszewski afirmou recentemente que a ElevenLabs pretende realizar uma oferta pública inicial “nos próximos anos”, embora não tenha fornecido um cronograma específico.
