
O que é o Dia (Nari Labs)?
Dia é um modelo de text-to-speech (TTS) open-source de 1,6 mil milhões de parâmetros, criado pela Nari Labs, uma startup apoiada pela Y Combinator (equipa entre São Francisco e Seul). Ao contrário da maioria das ferramentas nesta lista, o Dia não é um SaaS com login e subscrição — é um modelo de código aberto (licença Apache 2.0) que qualquer pessoa pode correr localmente, testar gratuitamente no Hugging Face, ou integrar via API de terceiros. Já ultrapassa 19 mil estrelas no GitHub e mais de 2 milhões de downloads no Hugging Face, e a própria Nari Labs apresenta-o em comparação directa com o ElevenLabs Studio.
Aviso importante: se pesquisares por “Nari Labs” vais encontrar vários domínios quase idênticos (narilabs.org, nariai.org, diaai.org, entre outros) que não são o site oficial — são páginas de terceiros com anúncios de produtos não relacionados e texto genérico repetitivo, a explorar o nome do projecto para tráfego de pesquisa. A fonte oficial é o GitHub da organização (github.com/nari-labs) e o site institucional nari-labs.com.
Principais funcionalidades
- Geração de diálogo com múltiplos falantes numa única passagem (tags [S1]/[S2])
- Sons não-verbais: risos, tosse, suspiros, sussurros, aplausos
- Clonagem de voz a partir de apenas 5-10 segundos de áudio de referência
- Controlo de emoção e tom através do áudio de condicionamento
- Dia2 (lançado em Nov/2025): variante em streaming, gera áudio em tempo real à medida que o texto chega, com versões de 1B e 2B parâmetros
- Demo gratuita nas Hugging Face Spaces, sem necessidade de instalação
Prós e Contras
Prós
- Totalmente gratuito e open-source (Apache 2.0) — sem custos de subscrição
- Qualidade de voz e clonagem competitiva com soluções pagas como o ElevenLabs
- Clonagem de voz com apenas alguns segundos de áudio
- Comunidade activa e desenvolvimento contínuo (Dia2 já em streaming)
- Sem lock-in — corre localmente ou em qualquer infraestrutura própria
Contras
- Suporta apenas inglês por enquanto
- Requer GPU (mínimo ~4,4GB VRAM) e conhecimentos técnicos para correr localmente
- Não é um produto polido com interface própria — é um modelo de investigação
- Vozes variam entre gerações, salvo se usares um prompt de áudio ou seed fixa
- Sem suporte comercial oficial nem SLA
Como experimentar
- Sem instalar nada: demo gratuita nas Hugging Face Spaces
- Localmente: clonar o repositório GitHub e correr via Python/uv (requer GPU NVIDIA)
- Via Transformers: integração directa com a biblioteca Hugging Face Transformers
Dia vs ElevenLabs
- Dia — gratuito, open-source, ideal para developers com GPU própria que querem controlo total e sem custos recorrentes; requer conhecimento técnico
- ElevenLabs — pago, mas pronto a usar em minutos, com interface polida, suporte a português (europeu e brasileiro) e API bem documentada
Se procuras uma solução profissional pronta a usar em português, o ElevenLabs continua a ser a escolha mais simples. Se és developer, tens GPU disponível e queres uma alternativa gratuita e sem restrições comerciais rígidas, o Dia é uma das opções open-source mais impressionantes de 2026.
Para quem é?
Ideal para developers e investigadores que querem experimentar TTS de ponta sem custos de subscrição, para quem constrói produtos próprios sobre um modelo open-source, e para entusiastas técnicos com GPU disponível. Não é a escolha certa para quem procura uma ferramenta pronta a usar sem conhecimentos técnicos — nesse caso, o ElevenLabs ou o Murf AI são mais adequados.
Conclusão
O Dia é uma das provas mais claras de que o open-source está a aproximar-se rapidamente da qualidade dos líderes pagos em TTS. Não é uma ferramenta “instalar e usar” como as restantes reviews deste site — é um projecto de investigação genuinamente sólido, com tracção real (19K+ estrelas, apoio da Y Combinator, comparações directas com o ElevenLabs). Só fica um aviso: acede sempre através das fontes oficiais (GitHub ou nari-labs.com), não através dos vários sites-clone que circulam com o mesmo nome.