
Última atualização: setembro de 2026.
O que é o Whisper OpenAI
Whisper é o modelo de reconhecimento de fala (ASR) open-source da OpenAI, lançado em 2022 e ainda em 2026 considerado um dos mais precisos do mercado. Suporta mais de 99 idiomas incluindo português com excelente qualidade, pode ser corrido localmente de forma gratuita, e está disponível via API da OpenAI para integração em aplicações.
Versões disponíveis
- Tiny — mínimo, muito rápido, menos preciso
- Base — equilíbrio básico
- Small — boa qualidade em hardware limitado
- Medium — boa qualidade geral
- Large V3 — máxima precisão
- Large V3 Turbo — 6x mais rápido do que o Large V2 com precisão quase idêntica (lançado em 2024, hoje o mais usado)
Formas de usar
- Local via Python (pip install openai-whisper), totalmente gratuito
- API da OpenAI (a partir de $0,006/minuto)
- Groq API (Whisper Large V3 ultrarrápido)
- Replicate (sem GPU própria)
- Open WebUI — interface gráfica local
Vantagens e Desvantagens
Vantagens
- Totalmente gratuito e open-source quando corrido localmente
- Qualidade excepcional em português europeu e brasileiro, mesmo com sotaque ou fala espontânea
- Large V3 Turbo oferece a maior parte da precisão do Large V3 a uma fração do tempo de processamento
Desvantagens
- Correr localmente exige GPU decente para velocidade aceitável — em CPU pode ser lento
- A OpenAI lançou desde então o GPT-4o Transcribe e o GPT-4o Mini Transcribe, que competem com o próprio Whisper em precisão e, no caso do Mini, custam menos ($0,003/minuto vs $0,006/minuto do Whisper)
- Sem diarização nativa (identificação de quem fala) — é preciso combinar com outra ferramenta
Para quem é indicado
Developers que precisam de transcrição de qualidade em apps, criadores de conteúdo que transcrevem podcasts e vídeos, investigadores que analisam áudio, e qualquer pessoa que queira alternativa gratuita ao Google ou AWS Transcribe.
Não é a escolha certa para quem precisa de identificar automaticamente quem está a falar (diarização) sem trabalho extra, ou para quem procura o preço mais baixo possível via API — o GPT-4o Mini Transcribe da própria OpenAI já é mais barato.
Preços
- Local (self-hosted): gratuito, apenas custo de hardware/computação
- API OpenAI (Whisper): $0,006/minuto ($0,36/hora)
- API OpenAI (GPT-4o Mini Transcribe): $0,003/minuto — alternativa mais barata da própria OpenAI
- Créditos gratuitos: novas contas OpenAI recebem cerca de $5, suficientes para ~830 minutos de transcrição via Whisper
Whisper vs Google Speech-to-Text
O Whisper tem qualidade excepcionalmente boa em português europeu e brasileiro — muito superior ao Google Speech-to-Text para conteúdo espontâneo, reuniões e conteúdo com sotaque. É a escolha de referência para transcrição de podcasts e vídeos em português, sobretudo quando corrido localmente sem custo por minuto.
Perguntas Frequentes
O Whisper é mesmo gratuito?
Sim, para uso local — é open-source. Só a via API da OpenAI é paga, por minuto de áudio.
Qual a versão mais rápida?
O Large V3 Turbo, lançado em 2024: cerca de 6x mais rápido do que o Large V2 com precisão quase idêntica ao Large V3.
O Whisper ainda é a melhor opção da OpenAI para transcrição?
Não necessariamente — o GPT-4o Mini Transcribe é mais barato ($0,003/minuto vs $0,006/minuto), e vale comparar qualidade consoante o caso de uso.
Identifica quem está a falar numa gravação?
Não nativamente — é preciso combinar com uma ferramenta de diarização à parte.
Conclusão
O Whisper continua um dos melhores produtos open-source da OpenAI, com qualidade de transcrição excelente em português e sem custo quando corrido localmente. Para integração em apps, vale comparar o preço com as alternativas mais recentes da própria OpenAI antes de assumir que a API do Whisper é sempre a opção mais barata.