Se você transcreve áudios, entrevistas, reuniões, podcasts ou aulas e já se perguntou "tem um jeito mais simples e barato de fazer isso?", a resposta é sim.
E o melhor: dá pra rodar no seu próprio notebook, sem mandar arquivo nenhum pra nuvem.
1. Pra quem é esse guia
Você é jornalista, pesquisador(a), professor(a), advogado(a), assistente administrativo, psicólogo(a), produtor(a) de conteúdo, estudante de pós… enfim, você lida com muitas horas de áudio no mês, mas não é programador(a). Talvez tenha até tentado usar ferramentas online e descobriu que:
- Têm limite de tamanho de arquivo (e aquela reunião de 2h não cabe).
- Cobram por minuto transcrito (e no fim do mês a fatura dói).
- Não garantem privacidade (o áudio do seu cliente vai pra servidor de terceiros).
- Ou simplesmente travam no meio do arquivo.
Esse artigo é pra você. Vou te mostrar, passo a passo, como instalar e usar o Whisper da OpenAI direto no seu computador, mesmo que ele não tenha placa de vídeo boa, e mesmo que você nunca tenha aberto o terminal na vida.
2. O que é o Whisper (em 30 segundos, sem jargão)
O Whisper é um modelo de inteligência artificial criado pela OpenAI (os mesmos do ChatGPT), que serve para ouvir áudios e transformá-los em texto. Ele entende português incrivelmente bem — sotaques, gírias, termos técnicos — e funciona offline. Ou seja, depois de instalado, não precisa mais de internet para transcrever.
Ele é gratuito e open source (código aberto). Você não paga nada por uso, não tem limite de minutos e ninguém fica olhando seus arquivos.
A grande novidade agora é o modelo large-v3-turbo. Antes, você precisava escolher entre ser rápido (mas errar algumas palavras) ou ser preciso (e demorar horas). O modelo turbo mudou o jogo: ele entrega a qualidade absurda dos modelos gigantes, mas rodando em uma fração do tempo.
3. O que você vai precisar (e provavelmente já tem)
| Item | O que é | Mínimo aceitável |
|---|---|---|
| Computador | Windows 10/11, macOS 11+ ou Linux | Qualquer um dos últimos 6 anos |
| Memória RAM | O "curto prazo" do seu PC | 8 GB (recomendado 16 GB) |
| Espaço em disco | Onde o Whisper vai morar | 5 GB livres |
| Processador | O "cérebro" do PC | Intel i5 de 8ª gen / Ryzen 5 2000+ ou Apple M1+ |
| Placa de vídeo (GPU) | Acelera o processo (opcional) | Não precisa |
| Internet | Só pra instalar (uma única vez) | Banda comum |
| Python | A linguagem que vamos usar | Versão 3.9 a 3.12 |
Não tem GPU? Relaxa. O Whisper roda 100% no processador (CPU). É um pouco mais devagar que com placa de vídeo, mas funciona perfeitamente — dá tempo de ir tomar um café enquanto ele processa arquivos grandes.
4. Parte 1 — Instalando o Python (sem medo)
Se você já tem o Python instalado, pule pra Parte 2. Se não tem, vem comigo.
No Windows
- Acesse
python.org/downloads. - Clique no botão grande "Download Python 3.x.x".
- Importante: ao rodar o instalador, marque a caixinha "Add Python to PATH" lá embaixo. Essa é a parte que a maioria esquece e depois fica quebrando a cabeça.
- Clique em Install Now e pronto.
No macOS
Abra o terminal (aperte Cmd + Espaço, digite "terminal" e dê Enter) e cole:
/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"
brew install python
No Linux (Ubuntu/Debian)
sudo apt update
sudo apt install python3 python3-pip python3-venv
Como saber se deu certo?
Abra o terminal (no Windows, procure por "cmd" ou "PowerShell") e digite:
python --version
Se aparecer algo como Python 3.11.5 (ou similar), tá no caminho certo. ✅
5. Parte 2 — Criando um cantinho seguro pro projeto
Esse é um truque que programadores usam pra não misturar as coisas: a gente cria uma pasta isolada com tudo o que precisa dentro. Assim, se algo der errado, é só apagar a pasta e recomeçar.
mkdir whisper-local
cd whisper-local
python -m venv venv
Agora ative o ambiente:
- Windows (PowerShell):
.\venv\Scripts\Activate.ps1
(Se der erro vermelho sobre "execução de scripts", abra o PowerShell como administrador, rodeSet-ExecutionPolicy -Scope CurrentUser RemoteSigned, feche e tente de novo). - Windows (cmd):
venv\Scripts\activate.bat - macOS / Linux:
source venv/bin/activate
Você vai notar que aparece (venv) no início da linha. Isso é ótimo sinal — significa que você está "dentro" do cantinho.
6. Parte 3 — Instalando o Whisper (a parte mágica)
Com o ambiente ativado, rode:
pip install openai-whisper
Vai aparecer muita coisa rolando na tela — downloads, instalação, compilaçõezinhas. É normal. Pode demorar de 2 a 10 minutos dependendo da sua internet.
Em seguida, instale o ffmpeg, que é o "decodificador" de áudio que o Whisper usa por baixo dos panos:
- Windows (com Chocolatey):
choco install ffmpeg
(Sem Chocolatey: baixe em gyan.dev/ffmpeg/builds, extraia e adicione a pasta bin ao PATH do Windows). - macOS:
brew install ffmpeg - Linux (Ubuntu/Debian):
sudo apt install ffmpeg
7. Parte 4 — Sua primeira transcrição
Crie um arquivo chamado transcrever.py dentro da pasta whisper-local (pode usar o Bloco de Notas, VS Code, ou o que preferir) e cole isto:
import whisper
# Carrega o modelo turbo (a versão ultra otimizada do large-v3).
# Na primeira vez, ele vai baixar o modelo da internet (aprox. 1.6 GB).
# Ele é super rápido e extremamente preciso em português.
modelo = whisper.load_model("turbo")
# Coloque aqui o caminho do seu arquivo (mp3, m4a, wav, mp4, etc.)
arquivo = "minha_reuniao.mp3"
# A mágica acontece aqui
resultado = modelo.transcribe(arquivo, language="portuguese")
# Salva em um arquivo de texto
with open("transcricao.txt", "w", encoding="utf-8") as f:
f.write(resultado["text"])
print("✅ Pronto! Arquivo salvo como transcricao.txt")
Como usar:
- Coloque um arquivo de áudio (ex:
minha_reuniao.mp3) dentro da pastawhisper-local. - No terminal (com o
(venv)ainda ativo), rode:python transcrever.py - Vá tomar um café. ☕ Com o novo modelo turbo, um áudio de 30 minutos costuma ser processado muito mais rápido que nas versões anteriores.
- Quando voltar, abra o arquivo
transcricao.txte veja a mágica.
8. Parte 5 — Versão turbinada (com timestamps e legendas)
Se você precisa saber em que minuto cada frase foi dita (útil pra legendagem, pra citar trechos em uma tese, ou achar partes de uma reunião), use esta versão:
import whisper
from whisper.utils import get_writer
# Usando o poderoso modelo turbo
modelo = whisper.load_model("turbo")
resultado = modelo.transcribe(
"minha_reuniao.mp3",
language="portuguese",
task="transcribe",
verbose=True # mostra o progresso em tempo real na tela
)
# Texto puro
with open("transcricao.txt", "w", encoding="utf-8") as f:
f.write(resultado["text"])
# Legenda .srt (perfeita pra vídeos)
escritor = get_writer("srt", ".")
escritor(resultado, "minha_reuniao.mp3")
print("✅ Texto e legenda .srt gerados!")
Bônus: troque "srt" por "vtt" se precisar de legendas para a web, ou por "tsv" se quiser uma planilha com cada frase numa linha (com horário de início, fim e texto).
9. Dicas práticas (a parte que economiza horas)
9.1. Escolhendo o modelo certo
O Whisper tem vários tamanhos. Antes, a escolha era difícil. Hoje, com o turbo, a decisão ficou óbvia.
| Modelo | Tamanho | RAM | Velocidade CPU | Qualidade |
|---|---|---|---|---|
| tiny | 75 MB | ~1 GB | ⚡⚡⚡⚡⚡ | ⭐⭐ |
| base | 140 MB | ~1 GB | ⚡⚡⚡⚡ | ⭐⭐⭐ |
| small | 460 MB | ~2 GB | ⚡⚡⚡ | ⭐⭐⭐⭐ |
| medium | 1.5 GB | ~5 GB | ⚡⚡ | ⭐⭐⭐⭐⭐ |
| turbo | 1.6 GB | ~6 GB | ⚡⚡⚡⚡ | ⭐⭐⭐⭐⭐ |
| large | ~3 GB | ~10 GB | ⚡ | ⭐⭐⭐⭐⭐ |
Minha recomendação honesta: Vá direto de turbo. Ele é praticamente tão rápido quanto o base e o small, mas carrega toda a precisão do large-v3. É o ponto de equilíbrio perfeito para quem não quer perder tempo corrigindo texto depois.
9.2. Transcrevendo vários arquivos de uma vez
import whisper
from pathlib import Path
# Carregando o campeão de custo-benefício
modelo = whisper.load_model("turbo")
pasta = Path("./audios") # coloque todos os seus arquivos nesta pasta
for arquivo in pasta.glob("*"):
if arquivo.suffix.lower() in [".mp3", ".wav", ".m4a", ".mp4"]:
print(f"🎙️ Transcrevendo: {arquivo.name}")
resultado = modelo.transcribe(str(arquivo), language="portuguese")
saida = arquivo.with_suffix(".txt")
saida.write_text(resultado["text"], encoding="utf-8")
print("✅ Todos os arquivos foram transcritos!")
9.3. Traduzindo áudio em outra língua pra português
resultado = modelo.transcribe("palestra_ingles.mp3", task="translate")
Ele vai te entregar o áudio em inglês traduzido direto para português. O modelo turbo é excelente para isso!
9.4. Forçando o reconhecimento de termos específicos
resultado = modelo.transcribe(
"entrevista.mp3",
language="portuguese",
initial_prompt="Entrevista com Dr. Almeida sobre LGPD, COAF e compliance na Descomplica Comunicação."
)
O initial_prompt é um "contexto" — o Whisper usa isso para entender melhor do que se trata o áudio e acertar na mosca os nomes próprios e termos técnicos difíceis.
10. Problemas comuns (e como resolver)
- ❌
ModuleNotFoundError: No module named 'whisper'
Você provavelmente esqueceu de ativar o(venv)antes de rodar. Volte lá e ative. - ❌
ffmpeg not found
O ffmpeg não foi instalado ou não está no PATH do seu sistema. Reinstale seguindo a Parte 3. - ❌ O processo morre com erro de memória
Seu computador pode ter pouca RAM para o modeloturbo. Tente fechar o navegador, o Spotify e outros programas pesados, ou mude para o modelosmall. - ❌ A qualidade da transcrição tá ruim
Verifique o áudio. O Whisper faz milagres, mas muito ruído de fundo prejudica o resultado. Use a dica doinitial_prompt. - ❌ Tá MUITO demorado
Áudios muito longos só na CPU podem levar algum tempo. Se você tem muitos arquivos, deixe o PC ligado de noite. Se isso virou um gargalo de produtividade, talvez seja hora de profissionalizar o processo (mais sobre isso abaixo 👇).
11. E quando o "faça você mesmo" começa a atrapalhar?
Olha, vou ser bem honesto: o Whisper local é fantástico, mas nem sempre fazer na mão é a melhor escolha pro seu dia a dia. Antes de passar a próxima semana inteira configurando scripts, se pergunte:
- 📦 Você transcreve muitas horas por semana? Provavelmente já passou da hora de ter um pipeline automatizado (pasta de entrada → transcrição → documento final formatado).
- 👥 Sua equipe perde horas no trabalho "braçal"? Renomear, separar falas por entrevistado, gerar resumo... tudo isso drena produtividade.
- 🔒 Os áudios são sensíveis? Você lida com processos jurídicos ou dados sigilosos e precisa de garantia absoluta que NADA vai vazar para a nuvem?
- 📊 Faltam integrações? Você precisa que a transcrição caia direto no Notion, no seu CRM, no Google Drive ou num gerador de documentos?
Se você respondeu sim pra alguma dessas, continuar fazendo tudo no terminal não faz mais sentido comercial. E é exatamente aí que a gente entra.
👋 Conheça a Descomplica Comunicação
Nós tiramos toda a barreira técnica do seu caminho para você voltar a focar no que realmente importa no seu negócio. Ajudamos profissionais e empresas a:
- 🛠️ Montar infraestrutura local avançada: Instalamos e otimizamos tudo na sua máquina ou servidor dedicado (sem você precisar ler uma linha de código).
- ⚙️ Criar fluxos de automação pesada: Transformamos áudio bruto em atas de reunião prontas, resumos estratégicos e planilhas de forma 100% autônoma.
- 🔐 Garantir privacidade máxima: Soluções self-hosted rigorosas para quem trabalha com saúde, jurídico e dados corporativos sensíveis.
- 🧩 Integrar com seu ecossistema: Conectamos as IAs com as ferramentas que você já usa no dia a dia.
Você não precisa virar programador para extrair o máximo da inteligência artificial. Você só precisa de uma agência que descomplica isso para você.
💬 Fale com a gente
A primeira conversa é sem compromisso. Avaliamos juntos o seu cenário e te dizemos, com total honestidade, se o seu caso se resolve com uma solução simples caseira ou se vale a pena construir uma arquitetura personalizada de alto nível.
[Quero conversar com a Descomplica →]
12. Resumindo (pra quem só quer a cola)
- Instale o Python 3.9+ (marque "Add to PATH" no Windows).
- Crie uma pasta, abra o terminal dentro dela e rode
python -m venv venv. - Ative o ambiente (
.\venv\Scripts\Activate.ps1no Windows ousource venv/bin/activateno Mac/Linux). - Rode
pip install openai-whispere instale offmpeg. - Copie o script da Parte 4 garantindo que está usando
whisper.load_model("turbo"), troque o nome do seu áudio e rodepython transcrever.py. - Abra o
transcricao.txte celebre. 🎉
Pronto. Você acabou de colocar o estado da arte em transcrição rodando 100% no seu computador, de graça. E se a demanda crescer demais, você já sabe quem chamar! 😉