1. O que acontece durante a transcrição
No Windows, o TGIAPP usa o whisper.cpp e um modelo GGML instalado localmente. O aplicativo extrai o áudio do vídeo com FFmpeg, converte para WAV mono de 16 kHz e divide materiais longos em partes. Cada trecho é enviado ao processo local do Whisper, e os segmentos retornam com texto e marcações de tempo.
O arquivo de mídia não precisa ser enviado para uma API de transcrição. Isso preserva privacidade e permite trabalhar sem internet depois que executável e modelo estão instalados. O custo aparece em processamento: CPU, memória e tempo variam conforme duração, modelo e computador.
Importante: “local” descreve onde a transcrição acontece. Login e download de modelos opcionais podem usar internet quando escolhidos, mas o áudio transcrito não precisa sair da máquina.
2. Prepare o áudio que o modelo vai ouvir
Um modelo não separa perfeitamente voz, música, eco e falas simultâneas. Antes de transcrever, escolha o clipe com a voz mais clara e evite trechos em que duas pessoas falam ao mesmo tempo. Se o ruído constante domina, uma limpeza moderada pode ajudar. Processamento agressivo que cria artefatos também pode piorar o reconhecimento.
Nomes próprios, marcas, siglas e palavras de outro idioma são casos difíceis porque o modelo decide com base no som e no contexto. Prepare uma lista desses termos para a revisão. Em conteúdo técnico, números e unidades merecem atenção: “quinze” e “cinquenta”, por exemplo, podem se aproximar quando a gravação é rápida ou abafada.
Para melhorar a fonte, consulte o guia como deixar voz e áudio mais limpos.
3. Escolha o modelo pelo projeto
Modelos menores usam menos memória e costumam terminar mais rápido. Modelos maiores podem reconhecer melhor fala difícil, mas aumentam tempo de processamento e tamanho do download. O modelo Base atende ao fluxo gratuito e é um ponto de partida equilibrado. O Whisper Small é um componente opcional para contas com acesso correspondente.
| Prioridade | Escolha inicial | Conferência necessária |
|---|---|---|
| Velocidade | Modelo menor e áudio curto. | Revise mais nomes, pontuação e palavras rápidas. |
| Equilíbrio | Modelo Base. | Revise termos específicos e divisão das frases. |
| Qualidade difícil | Modelo maior disponível. | Ainda exige revisão; tamanho não garante acerto. |
Faça um teste em um minuto representativo antes de processar um vídeo longo. Escolha um trecho com o mesmo microfone, ambiente e vocabulário do restante. Assim você estima tempo e decide se a troca de modelo produz melhoria perceptível.
4. Gere as legendas na hora certa da edição
Finalize os cortes principais da fala antes de transcrever. Se você gerar legendas, alterar a ordem de vários clipes e remover pausas depois, os tempos podem deixar de corresponder à nova sequência. Ajustes pequenos ainda são possíveis, mas mudanças estruturais aumentam o trabalho de reposicionamento.
No editor, selecione o vídeo ou os vídeos desejados e abra a ferramenta de legendas. O serviço processa uma transcrição pesada por vez para evitar concorrência excessiva. Não feche o projeto durante a fila. Materiais longos são divididos internamente para limitar memória e permitir timeout por parte.
5. Revise em três passagens
Primeira passagem: fidelidade
Assista com som e corrija palavras erradas, nomes, números e negações. Uma palavra como “não” altera toda a frase e tem prioridade sobre pontuação estética. Verifique também se uma fala foi atribuída ao momento correto.
Segunda passagem: leitura
Leia sem depender do som. Quebre blocos longos em unidades de sentido. Evite deixar artigo ou preposição isolados na linha seguinte. A legenda precisa permanecer tempo suficiente para leitura, mas não deve continuar depois que outra ideia já começou.
Terceira passagem: quadro
Confira posição, contraste, tamanho e elementos que a legenda cobre. Em vídeo vertical, botões e descrições da plataforma ocupam laterais e parte inferior. Use margem segura e reposicione quando o rosto, uma interface ou outro texto importante estiver na mesma região.
6. Faça a legenda pertencer ao vídeo
Legibilidade vem antes do efeito. Use contraste entre texto e fundo, peso suficiente e sombra ou contorno quando a imagem muda muito. Uma fonte enorme reduz a quantidade de palavras por linha; uma fonte pequena obriga esforço em telas menores. Teste no tamanho real do celular, não apenas no monitor.
Animações como entrada “pop” podem combinar com conteúdo curto, mas a variação de tamanho não deve fazer as palavras saltarem para fora da margem. A versão 1.4.22 ajustou a escala proporcional entre preview e exportação para Shorts, quadrado e feed 4:5. Mesmo assim, assista ao arquivo exportado para conferir o render final.
7. Legenda embutida, SRT ou VTT?
Legenda embutida vira parte da imagem. Ela mantém aparência e posição em qualquer player, mas não pode ser desligada nem traduzida separadamente. SRT guarda texto e tempo em um formato simples, aceito por muitos editores e plataformas. VTT também suporta legendas temporizadas e é comum em reprodução na web.
| Formato | Vantagem | Limitação |
|---|---|---|
| Embutida | Aparência consistente e pronta para redes sociais. | Não pode ser ocultada ou editada depois. |
| SRT | Ampla compatibilidade e edição em texto. | Estilo visual depende do player ou plataforma. |
| VTT | Adequado para players e conteúdo web. | Nem toda plataforma aceita da mesma forma. |
Guarde uma cópia externa mesmo quando a legenda será embutida. O arquivo de texto facilita correções, tradução e reaproveitamento sem transcrever o áudio novamente.
8. Diagnóstico de falhas comuns
- Whisper não encontrado: confira executável e modelo na ferramenta de diagnóstico.
- Processamento muito lento: teste um modelo menor, feche tarefas pesadas e reduza o trecho.
- Texto vazio: confirme que o clipe possui áudio audível e não está mudo.
- Muitos erros semelhantes: reveja a gravação, o idioma falado e o modelo escolhido.
- Tempos deslocados: confirme se a timeline foi alterada depois da transcrição.
- Exportação diferente do preview: gere um trecho curto e registre formato, posição e animação usados.
A página de suporte e diagnóstico explica como localizar dependências e relatar uma falha sem publicar mídia privada.