Transcrição local

Como criar legendas
e revisar o que a IA ouviu.

Transcrição automática reduz o trabalho mecânico, mas não elimina a revisão. Qualidade do áudio, modelo escolhido, vocabulário e ritmo da fala afetam o resultado. Este guia explica o fluxo local do TGIAPP e como transformar uma transcrição em legenda legível.

1. O que acontece durante a transcrição

No Windows, o TGIAPP usa o whisper.cpp e um modelo GGML instalado localmente. O aplicativo extrai o áudio do vídeo com FFmpeg, converte para WAV mono de 16 kHz e divide materiais longos em partes. Cada trecho é enviado ao processo local do Whisper, e os segmentos retornam com texto e marcações de tempo.

O arquivo de mídia não precisa ser enviado para uma API de transcrição. Isso preserva privacidade e permite trabalhar sem internet depois que executável e modelo estão instalados. O custo aparece em processamento: CPU, memória e tempo variam conforme duração, modelo e computador.

Importante: “local” descreve onde a transcrição acontece. Login e download de modelos opcionais podem usar internet quando escolhidos, mas o áudio transcrito não precisa sair da máquina.

2. Prepare o áudio que o modelo vai ouvir

Um modelo não separa perfeitamente voz, música, eco e falas simultâneas. Antes de transcrever, escolha o clipe com a voz mais clara e evite trechos em que duas pessoas falam ao mesmo tempo. Se o ruído constante domina, uma limpeza moderada pode ajudar. Processamento agressivo que cria artefatos também pode piorar o reconhecimento.

Nomes próprios, marcas, siglas e palavras de outro idioma são casos difíceis porque o modelo decide com base no som e no contexto. Prepare uma lista desses termos para a revisão. Em conteúdo técnico, números e unidades merecem atenção: “quinze” e “cinquenta”, por exemplo, podem se aproximar quando a gravação é rápida ou abafada.

Para melhorar a fonte, consulte o guia como deixar voz e áudio mais limpos.

3. Escolha o modelo pelo projeto

Modelos menores usam menos memória e costumam terminar mais rápido. Modelos maiores podem reconhecer melhor fala difícil, mas aumentam tempo de processamento e tamanho do download. O modelo Base atende ao fluxo gratuito e é um ponto de partida equilibrado. O Whisper Small é um componente opcional para contas com acesso correspondente.

PrioridadeEscolha inicialConferência necessária
VelocidadeModelo menor e áudio curto.Revise mais nomes, pontuação e palavras rápidas.
EquilíbrioModelo Base.Revise termos específicos e divisão das frases.
Qualidade difícilModelo maior disponível.Ainda exige revisão; tamanho não garante acerto.

Faça um teste em um minuto representativo antes de processar um vídeo longo. Escolha um trecho com o mesmo microfone, ambiente e vocabulário do restante. Assim você estima tempo e decide se a troca de modelo produz melhoria perceptível.

4. Gere as legendas na hora certa da edição

Finalize os cortes principais da fala antes de transcrever. Se você gerar legendas, alterar a ordem de vários clipes e remover pausas depois, os tempos podem deixar de corresponder à nova sequência. Ajustes pequenos ainda são possíveis, mas mudanças estruturais aumentam o trabalho de reposicionamento.

No editor, selecione o vídeo ou os vídeos desejados e abra a ferramenta de legendas. O serviço processa uma transcrição pesada por vez para evitar concorrência excessiva. Não feche o projeto durante a fila. Materiais longos são divididos internamente para limitar memória e permitir timeout por parte.

5. Revise em três passagens

Primeira passagem: fidelidade

Assista com som e corrija palavras erradas, nomes, números e negações. Uma palavra como “não” altera toda a frase e tem prioridade sobre pontuação estética. Verifique também se uma fala foi atribuída ao momento correto.

Segunda passagem: leitura

Leia sem depender do som. Quebre blocos longos em unidades de sentido. Evite deixar artigo ou preposição isolados na linha seguinte. A legenda precisa permanecer tempo suficiente para leitura, mas não deve continuar depois que outra ideia já começou.

Terceira passagem: quadro

Confira posição, contraste, tamanho e elementos que a legenda cobre. Em vídeo vertical, botões e descrições da plataforma ocupam laterais e parte inferior. Use margem segura e reposicione quando o rosto, uma interface ou outro texto importante estiver na mesma região.

6. Faça a legenda pertencer ao vídeo

Legibilidade vem antes do efeito. Use contraste entre texto e fundo, peso suficiente e sombra ou contorno quando a imagem muda muito. Uma fonte enorme reduz a quantidade de palavras por linha; uma fonte pequena obriga esforço em telas menores. Teste no tamanho real do celular, não apenas no monitor.

Animações como entrada “pop” podem combinar com conteúdo curto, mas a variação de tamanho não deve fazer as palavras saltarem para fora da margem. A versão 1.4.22 ajustou a escala proporcional entre preview e exportação para Shorts, quadrado e feed 4:5. Mesmo assim, assista ao arquivo exportado para conferir o render final.

7. Legenda embutida, SRT ou VTT?

Legenda embutida vira parte da imagem. Ela mantém aparência e posição em qualquer player, mas não pode ser desligada nem traduzida separadamente. SRT guarda texto e tempo em um formato simples, aceito por muitos editores e plataformas. VTT também suporta legendas temporizadas e é comum em reprodução na web.

FormatoVantagemLimitação
EmbutidaAparência consistente e pronta para redes sociais.Não pode ser ocultada ou editada depois.
SRTAmpla compatibilidade e edição em texto.Estilo visual depende do player ou plataforma.
VTTAdequado para players e conteúdo web.Nem toda plataforma aceita da mesma forma.

Guarde uma cópia externa mesmo quando a legenda será embutida. O arquivo de texto facilita correções, tradução e reaproveitamento sem transcrever o áudio novamente.

8. Diagnóstico de falhas comuns

  • Whisper não encontrado: confira executável e modelo na ferramenta de diagnóstico.
  • Processamento muito lento: teste um modelo menor, feche tarefas pesadas e reduza o trecho.
  • Texto vazio: confirme que o clipe possui áudio audível e não está mudo.
  • Muitos erros semelhantes: reveja a gravação, o idioma falado e o modelo escolhido.
  • Tempos deslocados: confirme se a timeline foi alterada depois da transcrição.
  • Exportação diferente do preview: gere um trecho curto e registre formato, posição e animação usados.

A página de suporte e diagnóstico explica como localizar dependências e relatar uma falha sem publicar mídia privada.