Voice & Transcription

Transcribe WhatsApp audio: notas de voz para PDF de texto (2026)

Como fazer transcribe WhatsApp audio em 2026: espanhol, hindi, árabe e mais 14 idiomas. Preço por chat para notas de voz convertidas em PDF pesquisável.

Notas de voz do WhatsApp sendo convertidas para um PDF de transcrição pesquisável com nomes e horários preservados
Visual guide to transcribe whatsapp audio

Eu construí esse fluxo para manter cada transcrição junto do remetente, do horário e da posição original na conversa, sem fingir que o texto automático substitui a conferência do áudio.

O que "transcribe WhatsApp audio" realmente significa (e por que é mais difícil do que parece)

As pessoas usam a expressão "transcribe WhatsApp audio" para se referir a pelo menos três coisas diferentes. Algumas querem transcrever chamadas de voz ao vivo — o que o WhatsApp não expõe por nenhuma API de desenvolvedor e que é tecnicamente uma categoria de produto separada do que descrevo aqui. Outras querem converter arquivos de áudio que salvaram do WhatsApp para texto, tratando o arquivo .opus como entrada independente. E outras — o maior grupo — querem que cada nota de voz dentro de um chat exportado do WhatsApp seja convertida para texto legível, de modo que a conversa inteira faça sentido como documento.

O ChatToPDF foi criado para esse terceiro caso. O problema que ele resolve é específico: você exporta um chat do WhatsApp que contém mensagens de texto e notas de voz, e o que você recebe do WhatsApp é um ZIP contendo um _chat.txt e uma pasta de arquivos de mídia. O _chat.txt tem linhas como <attached: 00000012-AUDIO-2024-03-15-09-22-31.opus> onde a nota de voz pertence. Nada converte essas referências em texto legível para você a menos que você construa algo para fazer isso.

Aqui está o que ninguém te conta: mesmo quando as pessoas encontram uma ferramenta de transcrição, frequentemente se deparam com um problema estrutural. As ferramentas que lidam com arquivos de áudio genéricos — faça upload de um MP3, receba texto de volta — não sabem onde na conversa aquele áudio pertence. Elas transcrevem o arquivo mas perdem o contexto. Você acaba com um bloco de texto separado sem nome de remetente, sem horário, sem indicação do que foi dito antes ou depois. Para um processo jurídico, um registro empresarial ou um arquivo familiar, esse contexto é o ponto central.

O que construí faz o seguinte: lê o _chat.txt para entender a estrutura da conversa, combina cada referência .opus com o arquivo de áudio correto no ZIP, transcreve o áudio e insere a transcrição de volta na posição exata correta na conversa — com o nome do remetente e o horário original do WhatsApp preservados. Esse detalhe me preocupou muito durante o desenvolvimento porque, sem ele, o contexto se perde. O resultado é um único PDF onde mensagens de texto e transcrições de notas de voz se alternam naturalmente, exatamente como a conversa aconteceu.

É esse o problema sobre o qual trata este guia.

Notas de voz não são arquivos — são um stream interno do app

Notas de voz do WhatsApp exibidas como bolhas de áudio no app, não como arquivos de áudio avulsos, no iPhone e Android

As notas de voz do WhatsApp parecem arquivos de áudio dentro do app — uma barra de forma de onda, uma duração, um botão de reprodução — mas não são armazenadas do jeito que a maioria das pessoas espera. Quando você grava uma nota de voz no WhatsApp pressionando o botão do microfone, o WhatsApp codifica o áudio usando o codec Opus e salva como um arquivo .opus em um diretório privado no dispositivo. Esse diretório não é acessível por navegação de arquivos normal no iPhone ou no Android. Você não pode navegar até ele no app Arquivos e encontrar suas notas de voz ali.

A única forma de extrair esses arquivos .opus é pelo menu Exportar conversa do WhatsApp, com "Incluir mídia" selecionado. Quando você exporta dessa forma, o WhatsApp empacota o registro de mensagens _chat.txt junto com a pasta de mídia — e é aí que os arquivos .opus aparecem. No iOS, eles ficam dentro do ZIP. No Android, versões mais antigas do WhatsApp exportavam para uma pasta no armazenamento interno; versões mais novas criam um ZIP pela tela de compartilhamento, igual ao iOS.

O Opus foi projetado para transportar voz com eficiência, mas uma exportação não tem taxa de amostragem, bitrate ou tamanho de arquivo universais. O WhatsApp pode gerar arquivos ou contêineres diferentes conforme o tipo de mensagem, o aparelho e a versão. Para uma análise exata, inspecione o arquivo real com VLC ou ffprobe; ruído, distância do microfone e vozes sobrepostas influenciam mais a transcrição do que a extensão sozinha.

Por isso o roteamento e a revisão importam. O ChatToPDF envia cada arquivo compatível ao provedor apropriado sem prometer uma configuração fixa nem precisão idêntica para todas as gravações.

Mais um ponto estrutural: cada nota de voz do WhatsApp é uma gravação de único remetente. O modelo push-to-talk do WhatsApp significa que uma pessoa grava, então para, então a outra pessoa grava sua resposta. Isso é na verdade uma vantagem para transcrição — ao contrário de uma chamada gravada onde duas vozes se sobrepõem na mesma faixa de áudio, cada arquivo .opus em uma exportação do WhatsApp pertence a exatamente um remetente. O ChatToPDF usa os metadados do _chat.txt para atribuir cada transcrição à pessoa correta, que é como você obtém uma conversa que se lê claramente mesmo quando as pessoas se alternam em notas de voz.

Como o roteador escolhe o motor de transcrição

Fluxo: upload ZIP, detecção de idioma e roteamento por Nova-3 ou Scribe v2

O ChatToPDF não depende mais de um único motor. A rota atual escolhe por nota entre Deepgram Nova-3 e ElevenLabs Scribe v2 conforme o idioma suportado e a disponibilidade do provedor. O Nova-3 cobre seu subconjunto de idiomas; o Scribe v2 amplia o registro completo para 93 idiomas e também pode servir como rota alternativa.

O Whisper é impressionante para um modelo gratuito, mas rodei testes de precisão em um conjunto de arquivos .opus reais do WhatsApp em inglês, espanhol, hindi e árabe, e ele mostrou pontos fracos consistentes na alternância de código (uma nota de voz que mistura dois idiomas no meio de uma frase) e em sotaques de inglês não americano. Também não oferece SLAs comerciais ou garantias de disponibilidade, o que importa quando usuários pagantes estão esperando pela saída.

O AssemblyAI é uma opção competente e foi usado em um protótipo inicial. O caminho de produção atual combina Deepgram Nova-3 e ElevenLabs Scribe v2 para ampliar a cobertura de idiomas e oferecer uma rota alternativa conforme o idioma compatível e a disponibilidade.

O Deepgram Nova-3 continua sendo uma das rotas de produção, mas não é a única. As conversões $49 Premium+Voice e $99 Power User usam o mesmo roteador Nova-3/Scribe v2; a diferença é o limite de áudio, o pacote de saídas e a prioridade da fila, não uma promessa de precisão perfeita.

Onde o Nova-3 supera visivelmente motores de fala para texto mais antigos é em três pontos: sotaques regionais (inglês sul-africano, inglês indiano, português brasileiro), vocabulário técnico (nomes, endereços, termos de produtos que um modelo genérico interpretaria errado) e áudio com alternância de código onde um falante muda de idioma dentro de uma única nota de voz. Esses são os modos de falha específicos que motivaram a escolha do motor. A conversão $29 Premium por chat não inclui transcrição alguma — preserva as notas de voz como marcadores no PDF sem rodar o áudio por nenhum modelo.

O pipeline funciona assim: seu ZIP chega ao servidor do ChatToPDF, os arquivos de áudio suportados são extraídos e cada nota é enviada por HTTPS autenticado ao provedor escolhido pelo roteador: Deepgram Nova-3 ou ElevenLabs Scribe v2. As transcrições são então reinseridas na conversa nas posições corretas antes de o PDF ser renderizado.

Uma escolha deliberada no pipeline: não faço pré-processamento ou recodificação do áudio .opus suportado antes da transcrição. Nova-3 e Scribe v2 aceitam Opus nativamente, portanto o arquivo de origem pode ir direto ao provedor selecionado sem conversão prévia para WAV ou MP3.

Cobertura e precisão nos 93 idiomas suportados

Grade dos 93 idiomas suportados, incluindo 57 em faixas de precisão alta ou excelente

O registro atual do ChatToPDF cobre 93 idiomas; 57 aparecem em faixas de precisão alta ou excelente publicadas pelo provedor. Essas faixas ajudam a planejar a revisão, mas não garantem o resultado de uma gravação. Os idiomas abaixo são exemplos importantes, não a lista completa:

Exemplos de cobertura: inglês, espanhol, português, francês, alemão, italiano, árabe, hindi, indonésio, turco, russo, holandês, japonês, coreano, chinês, vietnamita e tailandês fazem parte do registro atual. Variantes regionais, nomes próprios, números, alternância intensa de idioma e gravações ruidosas devem ser conferidos com o áudio original; não publicamos uma taxa de erro fixa para um idioma ou uma gravação específica.

O roteador combina o subconjunto suportado pelo Deepgram Nova-3 com a cobertura completa do ElevenLabs Scribe v2. Consulte o diretório de 93 idiomas de transcrição para ver a lista atual e as faixas publicadas. Cobertura não substitui a revisão de nomes, números, dialetos, ruído ou trechos que serão citados.

O roteamento acontece por nota. Um chat pode conter notas em vários idiomas suportados, mas alternância intensa dentro de uma única nota continua mais difícil. Verifique especialmente trechos 50/50, nomes próprios e valores contra o áudio original.

Transcrição de amostra: nota de voz em espanhol → texto (exemplo real)

Nota de voz em espanhol do WhatsApp transcrita como texto: nome do falante, horário e transcrição renderizados no PDF

Esta é uma nota de voz real do WhatsApp transcrita no nível de conversão $49 Premium+Voice por chat. O falante era nativo de espanhol colombiano, gravado em um dispositivo Android em ambiente interno silencioso. Duração: 18 segundos. Tamanho do arquivo: ~28 KB no formato .opus.

Áudio original (parafraseado): Uma nota de voz casual confirmando um compromisso no dia seguinte, expressando preocupação com a saúde da outra pessoa e solicitando uma resposta por texto se os planos mudarem.

Saída da transcrição no PDF:

🎤 [Nota de voz — 0:18] "Hola, ¿cómo estás? Te llamo para confirmar la cita de mañana a las tres de la tarde. Si no puedes, mándame un mensaje. ¿Vale?"

O remetente é atribuído no PDF com o nome do _chat.txt, o horário é o que o WhatsApp registrou quando a nota de voz foi enviada, e a transcrição fica incorporada entre as mensagens de texto imediatamente antes e depois dela na conversa.

Alguns detalhes a observar neste exemplo. O marcador de registro formal ¿Vale? — mais próximo de "Tudo bem?" em significado — transcreveu corretamente em vez de ser confundido com bale ou omitido. A expressão de tempo a las tres de la tarde ("às três da tarde") foi renderizada com precisão, o que importa para uma confirmação de agendamento onde um erro seria enganoso. A entonação ascendente falada em ¿cómo estás? não foi ambígua o suficiente para produzir um erro de transcrição.

Onde a precisão do espanhol cai? Os erros mais comuns que vejo são homófonos: haya (subjuntivo de haber) versus halla (de hallar, encontrar), tubo (tubo) versus tuvo (passado de tener). Em fala casual rápida, esses são foneticamente idênticos. O Nova-3 usa o contexto ao redor para inferir a grafia correta na maioria das vezes, mas não é perfeito. Em um documento que será usado como registro jurídico, recomendo uma revisão humana leve de qualquer nota de voz onde a transcrição será citada literalmente.

Se você não precisar de transcrição — por exemplo, quer apenas as mensagens de texto convertidas para PDF e está satisfeito com referências de marcador para as notas de voz — a conversão $29 Premium por chat lida com esse caso a um preço menor. A conversão $49 Premium+Voice por chat é o passo certo quando você precisa do espanhol falado aparecer como texto legível no documento.

Transcrição de amostra: hindi (Hinglish misto) → texto (exemplo real)

Nota de voz em hindi-hinglish do WhatsApp transcrita com alternância de código Hinglish preservada no PDF

A alternância intensa de idioma dentro de uma única nota continua difícil em qualquer rota. Nova-3 e Scribe v2 têm coberturas diferentes; nomes, números e trechos citados devem ser conferidos com o áudio original em vez de assumir uma vantagem percentual fixa.

Aqui está uma transcrição real da conversão $49 Premium+Voice por chat:

🎤 [Nota de voz — 0:22] "Yaar, kal meeting hai 3 baje, please attend karna. Project deadline aa rahi hai aur boss bahut strict hai."

Tradução: "Cara, tem uma reunião amanhã às 3, por favor apareça. O prazo do projeto está chegando e o chefe é muito rígido."

O exemplo em Hinglish ilustra um caso para revisão, não um benchmark universal: palavras inglesas inseridas numa frase em hindi podem ser preservadas ou alteradas conforme a gravação e a rota escolhida. Guarde o áudio e confira termos importantes.

A diferença importa quando você usa a transcrição como registro de trabalho. Se o gerente de alguém está revisando a transcrição de uma nota de voz como documentação de um compromisso de projeto e a palavra deadline não aparece no texto, isso não é uma questão menor de precisão — é uma informação que está faltando.

A atribuição do remetente vem de _chat.txt: o nome e o horário do WhatsApp aparecem junto da transcrição devolvida pelo provedor escolhido.

Uma observação sobre o hindi especificamente: se a nota de voz é em hindi de Devanagari dominante (hindi formal, de estilo escrito com mínimo de inglês), a precisão é consistentemente forte nos planos suportados. A conversão $49 Premium+Voice por chat é o ponto de entrada correto para qualquer nota de voz em hindi que você queira transcrever; a conversão $99 Power User por chat cobre a mesma precisão sem limite de áudio e com prioridade de fila. A conversão $29 Premium por chat preserva as notas de voz apenas como marcadores — nenhuma transcrição roda naquele plano.

O plano $49 Premium+Voice — o que inclui e o que não inclui

Plano $49 Premium+Voice com roteamento e limite de 8 horas de áudio

A conversão $49 Premium+Voice por chat é o plano que criei especificamente para chats com muita voz. Aqui está exatamente o que inclui e o que não inclui.

O que inclui a conversão $49 Premium+Voice por chat:

  • Roteamento sensível ao idioma — cada nota suportada pode passar pelo Deepgram Nova-3 ou pelo ElevenLabs Scribe v2
  • Um registro de 93 idiomas — 57 estão em faixas publicadas de precisão alta ou excelente; a cobertura não garante uma gravação específica
  • Até 8 horas de áudio em um único chat — cobre a vasta maioria das conversas com muita voz; se o áudio total do seu chat exceder 8 horas, a conversão $99 Power User por chat elimina esse limite
  • Sem teto de mensagens — sem limite superior no número de mensagens no chat que você está convertendo
  • Atribuição de remetente nas transcrições — cada transcrição no PDF carrega o nome do remetente do WhatsApp dos metadados da exportação
  • Horários preservados — o horário original do WhatsApp aparece junto com cada transcrição, não o horário da transcrição
  • Três formatos de saída — PDF, XLSX e CSV todos incluídos; o XLSX é útil se você quiser filtrar ou ordenar por remetente e horário
  • Retenção do arquivo-fonte por sete dias — criptografado em repouso (AES-256), em trânsito (TLS 1.3)

O que não inclui a conversão $49 Premium+Voice por chat:

  • Vocabulário especializado — o fluxo atual não aceita um glossário personalizado por upload; nomes próprios, siglas e termos raros devem ser conferidos com o áudio original

O plano acima deste — conversão $99 Power User por chat — inclui tudo na conversão $49 Premium+Voice por chat mais processamento em fila prioritária e tratamento de chat em massa. Se você está convertendo um único chat e a velocidade não é crítica (a maioria das conversões é concluída em menos de três minutos), a conversão $49 Premium+Voice por chat é o nível correto.

Árvore de decisão para transcribe WhatsApp audio: mapeando necessidades de voz para o plano correto do ChatToPDF
Cinco planos do ChatToPDF para transcribe WhatsApp audio de $7 Basic a $99 Power User por chat

Para referência, a pilha completa de planos: $7 Basic por chat (apenas texto, limite de 5.000 mensagens), $14 Standard por chat (imagens, limite de 25.000 mensagens), $29 Premium por chat (sem limite de produto para mensagens, XLSX/CSV, notas de voz como marcadores), $49 Premium+Voice por chat (roteador de 93 idiomas, limite de 8 horas de áudio) e $99 Power User por chat (o mesmo roteador, sem limite de duração do áudio e fila prioritária).

Por que não transcrevo em tempo real (e não vou adicionar)

Comparação de transcribe WhatsApp audio em tempo real versus assíncrono: latência, precisão e consumo de bateria

Isso aparece com frequência suficiente para merecer uma resposta direta. As pessoas perguntam por que o ChatToPDF não escuta as notas de voz conforme chegam — transcrevendo cada uma no momento em que é enviada — em vez de exigir uma exportação ZIP depois do fato.

A versão curta: o WhatsApp não dá acesso a mensagens recebidas ou áudio em tempo real a desenvolvedores. Não há endpoint oficial da API do WhatsApp Business que exponha notas de voz conforme chegam. O único caminho de acesso de terceiros suportado é pelo mecanismo Exportar conversa, que é um instantâneo da conversa em um ponto no tempo. Construir transcrição em tempo real sobre o WhatsApp exigiria interceptar o armazenamento local do app no dispositivo, o que é tecnicamente frágil e fora dos termos da política de plataforma do WhatsApp.

Mas há uma razão mais prática pela qual não tentei contornar essa restrição. O caso de uso para transcrever áudio do WhatsApp é quase inteiramente retrospectivo. Alguém recebe trinta notas de voz ao longo de uma disputa e quer um registro legível. Uma equipe de negócios usa notas de voz para atualizações de projetos e precisa que elas sejam pesquisáveis. Uma família manda notas de voz por anos e quer arquivá-las antes de trocar de celular. Nenhum desses casos envolve um requisito de "agora, enquanto chega". Todos são "tenho um conjunto de gravações que preciso converter".

Há também a questão da bateria e da rede. Manter uma conexão WebSocket aberta que transmite fragmentos de áudio para uma API de inferência em tempo real drenaria visivelmente a bateria de um celular ao longo de uma longa conversa. Exigiria uma conexão de internet ativa para cada nota de voz recebida, não apenas quando você escolhe converter. E criaria um fluxo de dados contínuo das suas conversas para um servidor de terceiros — o que não me sinto confortável em pedir aos usuários que aceitem.

O modelo de exportar e fazer upload é mais lento em tempo de relógio — você precisa esperar até estar pronto para converter, depois rodar a exportação, depois fazer o upload. Mas para os casos de uso reais que as pessoas têm, isso é aceitável. Ninguém está tentando transcrever uma nota de voz que recebeu três segundos atrás para um documento em tempo real. Elas estão convertendo um chat que querem manter.

Privacidade: onde vai o seu áudio e onde não vai

Fluxo de privacidade para audio do WhatsApp: upload, transcrição, armazenamento criptografado e exclusão em 7 dias

Esta é a parte sobre a qual quero ser específico porque a natureza das notas de voz — gravações de áudio de conversas reais — significa que o risco de privacidade é maior do que com mensagens de texto sozinhas.

Aqui está o caminho exato dos dados para uma nota de voz submetida pela conversão $49 Premium+Voice por chat:

Etapa 1 — Upload. Seu arquivo ZIP é transmitido do seu navegador para o servidor do ChatToPDF via HTTPS (TLS 1.3). A conexão é criptografada em trânsito. O ZIP chega em um diretório de processamento temporário, não em armazenamento permanente, enquanto a extração roda.

Etapa 2 — Extração. Os arquivos .opus são extraídos do ZIP. Cada arquivo é combinado com sua referência no _chat.txt pelo padrão de nome de arquivo. Neste ponto, os arquivos de áudio existem apenas no servidor de processamento do ChatToPDF.

Etapa 3 — Chamada ao provedor de transcrição. Cada arquivo suportado é enviado por uma chamada HTTPS autenticada ao provedor escolhido para aquela nota: Deepgram Nova-3 ou ElevenLabs Scribe v2. As solicitações ao Deepgram incluem a exclusão do programa de melhoria de modelos. O provedor recebe o áudio necessário para gerar a transcrição, não o texto completo do chat.

Etapa 4 — Armazenamento. A transcrição é agrupada no PDF e armazenada criptografada em repouso (AES-256) no AWS S3. O ZIP-fonte, incluindo os arquivos .opus, também é armazenado criptografado por sete dias.

Etapa 5 — Entrega. O link de download do PDF aparece na tela e no seu e-mail. O link está vinculado ao seu ID de job. Não é adivinhável e não está indexado em lugar nenhum.

Etapa 6 — Exclusão automática. Sete dias após a criação do job, o ZIP-fonte e o PDF de saída são excluídos do armazenamento automaticamente. Este é um job de exclusão agendado, não um processo manual. Não há exceções e não há extensões.

Para onde o seu áudio não vai: Não vai para nenhuma plataforma de análise. Não é usado para treinar modelos do ChatToPDF (o ChatToPDF não treina modelos). O conteúdo de texto das suas notas de voz não é visível para a equipe do ChatToPDF — o processamento é totalmente automatizado. Nenhum terceiro recebe o texto das suas mensagens de chat.

A etapa externa merece atenção em qualquer revisão de privacidade. O ChatToPDF controla seu próprio pipeline, mas Deepgram e ElevenLabs controlam seus processos conforme seus termos. Se as notas contêm informações privilegiadas, reguladas ou muito sensíveis, a equipe responsável deve revisar as condições atuais de ambos os provedores antes do upload.

Casos especiais: ruído de fundo, múltiplos falantes, efeitos de voz

Precisão de transcribe WhatsApp audio por nível de ruído: estúdio, silencioso, sala movimentada, externo e chamada móvel

Notas de voz reais do WhatsApp não são gravadas em estúdios isolados acusticamente. Elas são gravadas em carros, cozinhas, reuniões na rua e cafés barulhentos. Veja como cada um desses cenários afeta a precisão da transcrição e o que o ChatToPDF faz quando a precisão cai para um nível inaceitável.

Ruído de fundo por ambiente.

Uma nota de voz gravada em ambiente interno silencioso — um escritório, um quarto, uma sala tranquila — costuma ser mais fácil de transcrever do que uma nota com ruído, clipping, várias vozes ou alternância de idioma. A faixa publicada de um idioma não prevê o resultado de uma nota específica.

Múltiplos falantes dentro de uma única nota de voz.

Se outra pessoa falar de forma audível ao fundo, o provedor escolhido também pode transcrever essa voz. O resultado pode misturar as duas vozes sob o remetente do WhatsApp; confira esses trechos com o áudio.

O ChatToPDF atualmente não consegue isolar o falante primário e descartar vozes de fundo dentro de um único clipe .opus. A diarização de falantes — identificar quais segmentos de áudio vieram de qual pessoa no mesmo arquivo de áudio — é um recurso que estou avaliando para um plano futuro, mas requer infraestrutura adicional e não está na versão atual.

Efeitos de mudança de voz.

Para clipes onde a confiança cai abaixo do limite que defini no pipeline — atualmente definido como uma pontuação média de confiança de palavras abaixo de 0,6 em todo o clipe — o ChatToPDF marca a transcrição no PDF como [transcrição de baixa confiança — qualidade de áudio insuficiente] em vez de produzir um bloco de texto que poderia ser tomado como autoritativo. Você verá esse marcador no PDF final junto com a posição da nota de voz na conversa. É melhor sinalizar um resultado incerto do que retornar uma transcrição que parece plausível mas está 40% errada.

Perguntas frequentes

Qual formato de arquivo as notas de voz do WhatsApp usam, e o ChatToPDF lida com ele?

O WhatsApp normalmente salva notas de voz como áudio Opus em arquivos .opus. O ChatToPDF extrai o áudio suportado do ZIP de exportação e envia cada nota em seu formato nativo ao Deepgram Nova-3 ou ao ElevenLabs Scribe v2, conforme o roteador; não é necessária uma recodificação prévia.

Qual é a precisão da transcrição de áudio do WhatsApp?

A precisão depende principalmente da gravação. As conversões $49 Premium+Voice e $99 Power User usam o mesmo roteador Nova-3/Scribe v2; Power User altera o limite de áudio e a prioridade, não garante maior precisão. A conversão $29 Premium não transcreve. Ruído, vozes sobrepostas, clipping, sotaques, dialetos e alternância de idioma podem reduzir a qualidade, portanto confira nomes, datas, valores e citações contra o áudio original.

O ChatToPDF transcreve notas de voz em outros idiomas além do inglês?

Sim. As conversões $49 Premium+Voice e $99 Power User usam um roteador sensível ao idioma entre Deepgram Nova-3 e ElevenLabs Scribe v2 no registro atual de 93 idiomas; 57 estão em faixas publicadas de precisão alta ou excelente. O Scribe v2 cobre o registro completo e o Nova-3 seu subconjunto suportado. A cobertura não garante cada dialeto ou gravação. A conversão $29 Premium não transcreve notas de voz.

Preciso fazer algo diferente ao exportar do WhatsApp se quiser transcrições de voz?

Sim — um passo crítico. Ao exportar o chat do WhatsApp, escolha "Incluir mídia" em vez de "Sem mídia". As notas de voz (arquivos .opus) só são incluídas na exportação quando você seleciona Incluir mídia. Se você exportar Sem mídia, o _chat.txt conterá referências como <attached: 00000012-AUDIO-2024-03-15-09-22-31.opus> mas sem arquivos de áudio reais. O ChatToPDF não consegue transcrever uma nota de voz que não tem. Veja o guia de exportação de chat do WhatsApp para o processo de exportação passo a passo completo.

As transcrições de voz aparecerão no lugar certo no PDF?

Sim. O ChatToPDF lê o registro de mensagens no _chat.txt para entender a estrutura da conversa, combina cada referência .opus com o arquivo de áudio correspondente pelo nome do arquivo e insere a transcrição exatamente na posição da conversa onde a nota de voz foi enviada. O nome do remetente dos metadados do WhatsApp e o horário original aparecem junto com a transcrição. A saída é um único documento onde mensagens de texto e transcrições de notas de voz se alternam na ordem cronológica correta.

O que acontece com meus arquivos de áudio após a transcrição ser concluída?

Os arquivos de áudio ficam criptografados em repouso no job do ChatToPDF e são enviados apenas ao provedor selecionado para aquela nota: Deepgram ou ElevenLabs. As solicitações ao Deepgram excluem o áudio do programa de melhoria de modelos. A exclusão dos arquivos-fonte, do áudio extraído e dos downloads é programada aos sete dias; um job ainda em processamento pode receber uma prorrogação limitada de até 24 horas. Veja a seção de privacidade do WhatsApp to PDF.

O ChatToPDF consegue distinguir duas pessoas diferentes falando na mesma nota de voz?

Atualmente não. Cada nota de voz do WhatsApp é atribuída à pessoa que a enviou, usando as informações do remetente do _chat.txt. Dentro de uma única nota de voz, se o remetente e outra pessoa falam (por exemplo, o remetente está em uma conversa telefônica enquanto grava), as duas vozes são transcritas mas atribuídas ao remetente do WhatsApp. O ChatToPDF atualmente não roda diarização de falantes dentro de clipes de áudio individuais. Para notas de voz onde vozes de fundo são audíveis e inteligíveis, você pode ver fala intercalada na transcrição.

Cinco planos do ChatToPDF para transcribe WhatsApp audio de $7 Basic a $99 Power User por chat

Para o fluxo completo de chat para PDF — incluindo como exportar no iPhone e Android, o que o ZIP contém e como os cinco planos se comparam para conversões sem voz — veja o guia de WhatsApp to PDF. Se você está no Android e precisa mover a exportação para outro dispositivo antes de fazer o upload, o guia de transferência do Android para o iPhone cobre esse processo.

Paul · ChatToPDF

I'm Paul, the founder of ChatToPDF. I built it after needing a long WhatsApp conversation as a readable PDF for a legal matter. I test and document WhatsApp exports, PDF conversion, voice-note transcription, and the limits people should check before relying on the result.

Published 2026-05-12