Como usar Whisper localmente para transcrever áudio com IA, sem GPU e sem depender da nuvem

Como usar Whisper localmente para transcrever áudio com IA, sem GPU e sem depender da nuvem

Um guia passo a passo para não-programadores: como usar a inteligência artificial do Whisper para transformar horas de áudio em texto de graça, rápido e sem depender da nuvem.

Se você transcreve áudios, entrevistas, reuniões, podcasts ou aulas e já se perguntou "tem um jeito mais simples e barato de fazer isso?", a resposta é sim.

E o melhor: dá pra rodar no seu próprio notebook, sem mandar arquivo nenhum pra nuvem.

1. Pra quem é esse guia

Você é jornalista, pesquisador(a), professor(a), advogado(a), assistente administrativo, psicólogo(a), produtor(a) de conteúdo, estudante de pós… enfim, você lida com muitas horas de áudio no mês, mas não é programador(a). Talvez tenha até tentado usar ferramentas online e descobriu que:

  • Têm limite de tamanho de arquivo (e aquela reunião de 2h não cabe).
  • Cobram por minuto transcrito (e no fim do mês a fatura dói).
  • Não garantem privacidade (o áudio do seu cliente vai pra servidor de terceiros).
  • Ou simplesmente travam no meio do arquivo.

Esse artigo é pra você. Vou te mostrar, passo a passo, como instalar e usar o Whisper da OpenAI direto no seu computador, mesmo que ele não tenha placa de vídeo boa, e mesmo que você nunca tenha aberto o terminal na vida.

2. O que é o Whisper (em 30 segundos, sem jargão)

O Whisper é um modelo de inteligência artificial criado pela OpenAI (os mesmos do ChatGPT), que serve para ouvir áudios e transformá-los em texto. Ele entende português incrivelmente bem — sotaques, gírias, termos técnicos — e funciona offline. Ou seja, depois de instalado, não precisa mais de internet para transcrever.

Ele é gratuito e open source (código aberto). Você não paga nada por uso, não tem limite de minutos e ninguém fica olhando seus arquivos.

A grande novidade agora é o modelo large-v3-turbo. Antes, você precisava escolher entre ser rápido (mas errar algumas palavras) ou ser preciso (e demorar horas). O modelo turbo mudou o jogo: ele entrega a qualidade absurda dos modelos gigantes, mas rodando em uma fração do tempo.

3. O que você vai precisar (e provavelmente já tem)

Item O que é Mínimo aceitável
Computador Windows 10/11, macOS 11+ ou Linux Qualquer um dos últimos 6 anos
Memória RAM O "curto prazo" do seu PC 8 GB (recomendado 16 GB)
Espaço em disco Onde o Whisper vai morar 5 GB livres
Processador O "cérebro" do PC Intel i5 de 8ª gen / Ryzen 5 2000+ ou Apple M1+
Placa de vídeo (GPU) Acelera o processo (opcional) Não precisa
Internet Só pra instalar (uma única vez) Banda comum
Python A linguagem que vamos usar Versão 3.9 a 3.12

Não tem GPU? Relaxa. O Whisper roda 100% no processador (CPU). É um pouco mais devagar que com placa de vídeo, mas funciona perfeitamente — dá tempo de ir tomar um café enquanto ele processa arquivos grandes.


4. Parte 1 — Instalando o Python (sem medo)

Se você já tem o Python instalado, pule pra Parte 2. Se não tem, vem comigo.

No Windows

  1. Acesse python.org/downloads.
  2. Clique no botão grande "Download Python 3.x.x".
  3. Importante: ao rodar o instalador, marque a caixinha "Add Python to PATH" lá embaixo. Essa é a parte que a maioria esquece e depois fica quebrando a cabeça.
  4. Clique em Install Now e pronto.

No macOS

Abra o terminal (aperte Cmd + Espaço, digite "terminal" e dê Enter) e cole:

/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"
brew install python

No Linux (Ubuntu/Debian)

sudo apt update
sudo apt install python3 python3-pip python3-venv

Como saber se deu certo?

Abra o terminal (no Windows, procure por "cmd" ou "PowerShell") e digite:

python --version

Se aparecer algo como Python 3.11.5 (ou similar), tá no caminho certo. ✅


5. Parte 2 — Criando um cantinho seguro pro projeto

Esse é um truque que programadores usam pra não misturar as coisas: a gente cria uma pasta isolada com tudo o que precisa dentro. Assim, se algo der errado, é só apagar a pasta e recomeçar.

mkdir whisper-local
cd whisper-local
python -m venv venv

Agora ative o ambiente:

  • Windows (PowerShell): .\venv\Scripts\Activate.ps1
    (Se der erro vermelho sobre "execução de scripts", abra o PowerShell como administrador, rode Set-ExecutionPolicy -Scope CurrentUser RemoteSigned, feche e tente de novo).
  • Windows (cmd): venv\Scripts\activate.bat
  • macOS / Linux: source venv/bin/activate

Você vai notar que aparece (venv) no início da linha. Isso é ótimo sinal — significa que você está "dentro" do cantinho.


6. Parte 3 — Instalando o Whisper (a parte mágica)

Com o ambiente ativado, rode:

pip install openai-whisper

Vai aparecer muita coisa rolando na tela — downloads, instalação, compilaçõezinhas. É normal. Pode demorar de 2 a 10 minutos dependendo da sua internet.

Em seguida, instale o ffmpeg, que é o "decodificador" de áudio que o Whisper usa por baixo dos panos:

  • Windows (com Chocolatey): choco install ffmpeg
    (Sem Chocolatey: baixe em gyan.dev/ffmpeg/builds, extraia e adicione a pasta bin ao PATH do Windows).
  • macOS: brew install ffmpeg
  • Linux (Ubuntu/Debian): sudo apt install ffmpeg

7. Parte 4 — Sua primeira transcrição

Crie um arquivo chamado transcrever.py dentro da pasta whisper-local (pode usar o Bloco de Notas, VS Code, ou o que preferir) e cole isto:

import whisper

# Carrega o modelo turbo (a versão ultra otimizada do large-v3).
# Na primeira vez, ele vai baixar o modelo da internet (aprox. 1.6 GB).
# Ele é super rápido e extremamente preciso em português.
modelo = whisper.load_model("turbo")

# Coloque aqui o caminho do seu arquivo (mp3, m4a, wav, mp4, etc.)
arquivo = "minha_reuniao.mp3"

# A mágica acontece aqui
resultado = modelo.transcribe(arquivo, language="portuguese")

# Salva em um arquivo de texto
with open("transcricao.txt", "w", encoding="utf-8") as f:
    f.write(resultado["text"])

print("✅ Pronto! Arquivo salvo como transcricao.txt")

Como usar:

  1. Coloque um arquivo de áudio (ex: minha_reuniao.mp3) dentro da pasta whisper-local.
  2. No terminal (com o (venv) ainda ativo), rode: python transcrever.py
  3. Vá tomar um café. ☕ Com o novo modelo turbo, um áudio de 30 minutos costuma ser processado muito mais rápido que nas versões anteriores.
  4. Quando voltar, abra o arquivo transcricao.txt e veja a mágica.

8. Parte 5 — Versão turbinada (com timestamps e legendas)

Se você precisa saber em que minuto cada frase foi dita (útil pra legendagem, pra citar trechos em uma tese, ou achar partes de uma reunião), use esta versão:

import whisper
from whisper.utils import get_writer

# Usando o poderoso modelo turbo
modelo = whisper.load_model("turbo")

resultado = modelo.transcribe(
    "minha_reuniao.mp3",
    language="portuguese",
    task="transcribe",
    verbose=True  # mostra o progresso em tempo real na tela
)

# Texto puro
with open("transcricao.txt", "w", encoding="utf-8") as f:
    f.write(resultado["text"])

# Legenda .srt (perfeita pra vídeos)
escritor = get_writer("srt", ".")
escritor(resultado, "minha_reuniao.mp3")

print("✅ Texto e legenda .srt gerados!")

Bônus: troque "srt" por "vtt" se precisar de legendas para a web, ou por "tsv" se quiser uma planilha com cada frase numa linha (com horário de início, fim e texto).


9. Dicas práticas (a parte que economiza horas)

9.1. Escolhendo o modelo certo

O Whisper tem vários tamanhos. Antes, a escolha era difícil. Hoje, com o turbo, a decisão ficou óbvia.

Modelo Tamanho RAM Velocidade CPU Qualidade
tiny 75 MB ~1 GB ⚡⚡⚡⚡⚡ ⭐⭐
base 140 MB ~1 GB ⚡⚡⚡⚡ ⭐⭐⭐
small 460 MB ~2 GB ⚡⚡⚡ ⭐⭐⭐⭐
medium 1.5 GB ~5 GB ⚡⚡ ⭐⭐⭐⭐⭐
turbo 1.6 GB ~6 GB ⚡⚡⚡⚡ ⭐⭐⭐⭐⭐
large ~3 GB ~10 GB ⭐⭐⭐⭐⭐

Minha recomendação honesta: Vá direto de turbo. Ele é praticamente tão rápido quanto o base e o small, mas carrega toda a precisão do large-v3. É o ponto de equilíbrio perfeito para quem não quer perder tempo corrigindo texto depois.

9.2. Transcrevendo vários arquivos de uma vez

import whisper
from pathlib import Path

# Carregando o campeão de custo-benefício
modelo = whisper.load_model("turbo")
pasta = Path("./audios")  # coloque todos os seus arquivos nesta pasta

for arquivo in pasta.glob("*"):
    if arquivo.suffix.lower() in [".mp3", ".wav", ".m4a", ".mp4"]:
        print(f"🎙️ Transcrevendo: {arquivo.name}")
        resultado = modelo.transcribe(str(arquivo), language="portuguese")
        saida = arquivo.with_suffix(".txt")
        saida.write_text(resultado["text"], encoding="utf-8")

print("✅ Todos os arquivos foram transcritos!")

9.3. Traduzindo áudio em outra língua pra português

resultado = modelo.transcribe("palestra_ingles.mp3", task="translate")

Ele vai te entregar o áudio em inglês traduzido direto para português. O modelo turbo é excelente para isso!

9.4. Forçando o reconhecimento de termos específicos

resultado = modelo.transcribe(
    "entrevista.mp3",
    language="portuguese",
    initial_prompt="Entrevista com Dr. Almeida sobre LGPD, COAF e compliance na Descomplica Comunicação."
)

O initial_prompt é um "contexto" — o Whisper usa isso para entender melhor do que se trata o áudio e acertar na mosca os nomes próprios e termos técnicos difíceis.


10. Problemas comuns (e como resolver)

  • ModuleNotFoundError: No module named 'whisper'
    Você provavelmente esqueceu de ativar o (venv) antes de rodar. Volte lá e ative.
  • ffmpeg not found
    O ffmpeg não foi instalado ou não está no PATH do seu sistema. Reinstale seguindo a Parte 3.
  • O processo morre com erro de memória
    Seu computador pode ter pouca RAM para o modelo turbo. Tente fechar o navegador, o Spotify e outros programas pesados, ou mude para o modelo small.
  • A qualidade da transcrição tá ruim
    Verifique o áudio. O Whisper faz milagres, mas muito ruído de fundo prejudica o resultado. Use a dica do initial_prompt.
  • Tá MUITO demorado
    Áudios muito longos só na CPU podem levar algum tempo. Se você tem muitos arquivos, deixe o PC ligado de noite. Se isso virou um gargalo de produtividade, talvez seja hora de profissionalizar o processo (mais sobre isso abaixo 👇).

11. E quando o "faça você mesmo" começa a atrapalhar?

Olha, vou ser bem honesto: o Whisper local é fantástico, mas nem sempre fazer na mão é a melhor escolha pro seu dia a dia. Antes de passar a próxima semana inteira configurando scripts, se pergunte:

  • 📦 Você transcreve muitas horas por semana? Provavelmente já passou da hora de ter um pipeline automatizado (pasta de entrada → transcrição → documento final formatado).
  • 👥 Sua equipe perde horas no trabalho "braçal"? Renomear, separar falas por entrevistado, gerar resumo... tudo isso drena produtividade.
  • 🔒 Os áudios são sensíveis? Você lida com processos jurídicos ou dados sigilosos e precisa de garantia absoluta que NADA vai vazar para a nuvem?
  • 📊 Faltam integrações? Você precisa que a transcrição caia direto no Notion, no seu CRM, no Google Drive ou num gerador de documentos?

Se você respondeu sim pra alguma dessas, continuar fazendo tudo no terminal não faz mais sentido comercial. E é exatamente aí que a gente entra.

👋 Conheça a Descomplica Comunicação

Nós tiramos toda a barreira técnica do seu caminho para você voltar a focar no que realmente importa no seu negócio. Ajudamos profissionais e empresas a:

  • 🛠️ Montar infraestrutura local avançada: Instalamos e otimizamos tudo na sua máquina ou servidor dedicado (sem você precisar ler uma linha de código).
  • ⚙️ Criar fluxos de automação pesada: Transformamos áudio bruto em atas de reunião prontas, resumos estratégicos e planilhas de forma 100% autônoma.
  • 🔐 Garantir privacidade máxima: Soluções self-hosted rigorosas para quem trabalha com saúde, jurídico e dados corporativos sensíveis.
  • 🧩 Integrar com seu ecossistema: Conectamos as IAs com as ferramentas que você já usa no dia a dia.

Você não precisa virar programador para extrair o máximo da inteligência artificial. Você só precisa de uma agência que descomplica isso para você.

💬 Fale com a gente
A primeira conversa é sem compromisso. Avaliamos juntos o seu cenário e te dizemos, com total honestidade, se o seu caso se resolve com uma solução simples caseira ou se vale a pena construir uma arquitetura personalizada de alto nível.

[Quero conversar com a Descomplica →]


12. Resumindo (pra quem só quer a cola)

  1. Instale o Python 3.9+ (marque "Add to PATH" no Windows).
  2. Crie uma pasta, abra o terminal dentro dela e rode python -m venv venv.
  3. Ative o ambiente (.\venv\Scripts\Activate.ps1 no Windows ou source venv/bin/activate no Mac/Linux).
  4. Rode pip install openai-whisper e instale o ffmpeg.
  5. Copie o script da Parte 4 garantindo que está usando whisper.load_model("turbo"), troque o nome do seu áudio e rode python transcrever.py.
  6. Abra o transcricao.txt e celebre. 🎉

Pronto. Você acabou de colocar o estado da arte em transcrição rodando 100% no seu computador, de graça. E se a demanda crescer demais, você já sabe quem chamar! 😉

0 curtidas
0 compartilhamentos
Gostou do conteúdo?

Entre em contato conosco e descubra como podemos ajudar sua empresa a crescer.

0/2000