Voice & Transcription

Transcribe WhatsApp Audio: notas de voz a texto en PDF (2026)

Transcribe WhatsApp audio en 2026 en español, hindi, árabe y 14 idiomas más. Precio por chat para notas de voz convertidas a PDF de texto buscable.

Notas de voz de WhatsApp convirtiéndose a PDF de transcripción con nombres de remitente y marcas de tiempo
Visual guide to transcribe whatsapp audio

Qué significa "transcribir WhatsApp audio" realmente (y por qué es más difícil de lo que parece)

La gente usa la expresión "transcribir WhatsApp audio" para referirse a al menos tres cosas diferentes. Algunos quieren transcribir llamadas de voz en directo — algo que WhatsApp no expone a través de ninguna API para desarrolladores y que técnicamente es una categoría de producto distinta a lo que describo aquí. Otros quieren convertir archivos de audio que han guardado desde WhatsApp a texto, tratando el archivo .opus como entrada independiente. Y otros — el grupo más numeroso — quieren que cada nota de voz dentro de un chat exportado de WhatsApp se convierta en texto legible para que la conversación completa tenga sentido como documento.

ChatToPDF está construido para ese tercer caso de uso — y lo construí precisamente porque me enfrenté a esa necesidad. El problema que resuelve es específico: exportas un chat de WhatsApp que contiene tanto mensajes de texto como notas de voz, y lo que obtienes de WhatsApp es un ZIP con un _chat.txt y una carpeta de archivos multimedia. El _chat.txt tiene líneas como <attached: 00000012-AUDIO-2024-03-15-09-22-31.opus> donde pertenece la nota de voz. Nada convierte esas referencias en texto legible a menos que construyas algo para hacerlo.

Aquí está la parte que nadie te dice: incluso cuando la gente encuentra una herramienta de transcripción, a menudo se topa con un problema estructural. Las herramientas que gestionan archivos de audio genéricos — sube un MP3, recibe texto — no saben en qué parte de una conversación pertenece ese audio. Transcriben el archivo pero pierden el contexto. Acabas con un bloque de texto separado sin nombre de remitente, sin marca de tiempo, sin indicación de qué se dijo antes o después. Para un asunto legal, un registro empresarial o un archivo familiar, ese contexto es el punto central de todo.

Lo que yo construí hace lo siguiente: lee el _chat.txt para entender la estructura de la conversación, empareja cada referencia .opus con el archivo de audio correcto en el ZIP, transcribe el audio e inserta la transcripción de nuevo en la posición exacta de la conversación — con el nombre del remitente y la marca de tiempo original preservados. El resultado es un único PDF donde los mensajes de texto y las transcripciones de notas de voz se alternan de forma natural, exactamente como ocurrió la conversación.

Ese es el problema del que trata esta guía.

Las notas de voz no son archivos — son una transmisión integrada en la app

Notas de voz de WhatsApp como burbujas de audio en la app, no como archivos de audio independientes, en iPhone y Android

Las notas de voz de WhatsApp parecen archivos de audio dentro de la app — una barra de forma de onda, una duración, un botón de reproducción — pero no se almacenan de la manera que la mayoría espera. Cuando grabas una nota de voz en WhatsApp manteniendo pulsado el botón del micrófono, WhatsApp codifica el audio usando el códec Opus y lo guarda como archivo .opus en un directorio privado del dispositivo. Ese directorio no es accesible mediante la navegación normal de archivos ni en iPhone ni en Android. No puedes ir a la app Archivos y encontrar tus notas de voz allí.

La única forma de extraer esos archivos .opus es a través del menú Exportar chat de WhatsApp, con "Incluir archivos multimedia" seleccionado. Cuando exportas de esa forma, WhatsApp empaqueta el registro de mensajes _chat.txt junto con la carpeta de medios — y ahí es donde aparecen los archivos .opus. En iOS, acaban dentro del ZIP. En Android, versiones más antiguas de WhatsApp exportaban a una carpeta en el almacenamiento interno; las versiones más nuevas crean un ZIP a través del menú de compartir, igualando el comportamiento de iOS.

Opus está diseñado para voz eficiente, pero una exportación no tiene una frecuencia de muestreo, tasa de bits ni tamaño universal. WhatsApp puede entregar archivos y contenedores distintos según el tipo de mensaje, el dispositivo y la versión. Para una revisión precisa, comprueba el archivo real con una herramienta como VLC o ffprobe; el ruido, la distancia al micrófono y el habla superpuesta influyen más en la transcripción que la extensión por sí sola.

Por eso importa el enrutamiento y la revisión. ChatToPDF envía cada archivo compatible al proveedor adecuado sin prometer una configuración fija ni una precisión idéntica para todas las grabaciones.

Un punto estructural más: cada nota de voz de WhatsApp es una grabación de un único remitente. El modelo push-to-talk de WhatsApp significa que una persona graba, luego se detiene, luego la otra persona graba su respuesta. Esto es en realidad una ventaja para la transcripción — a diferencia de una llamada telefónica grabada donde dos voces se superponen en la misma pista de audio, cada archivo .opus en una exportación de WhatsApp pertenece a exactamente un remitente. ChatToPDF usa los metadatos de _chat.txt para atribuir cada transcripción a la persona correcta, lo que explica por qué obtienes una conversación que se lee con claridad incluso cuando ambas personas se alternan con notas de voz.

Cómo el enrutador elige el motor de transcripción

Flujo: ZIP, detección de idioma y enrutamiento por Nova-3 o Scribe v2

ChatToPDF ya no depende de un solo motor. La ruta actual elige por nota entre Deepgram Nova-3 y ElevenLabs Scribe v2 según el idioma compatible y la disponibilidad del proveedor. Nova-3 cubre su subconjunto de idiomas; Scribe v2 amplía el registro completo a 93 idiomas y también sirve como ruta alternativa cuando corresponde.

Whisper es impresionante para un modelo gratuito, pero realicé pruebas de precisión en un conjunto de archivos .opus reales de WhatsApp en inglés, español, hindi y árabe, y mostró debilidades consistentes en el cambio de código (una nota de voz que mezcla dos idiomas a mitad de la frase) y en acentos de inglés no estadounidenses. Tampoco ofrece SLAs comerciales ni garantías de disponibilidad, lo que importa cuando los usuarios que pagan están esperando su resultado.

AssemblyAI es una opción competente y se usó en un prototipo inicial. La ruta de producción actual combina Deepgram Nova-3 y ElevenLabs Scribe v2 para ampliar la cobertura lingüística y ofrecer una ruta alternativa según el idioma compatible y la disponibilidad.

Deepgram Nova-3 sigue siendo una de las rutas de producción, pero no es la única. La conversión $49 Premium+Voice y la conversión $99 Power User usan el mismo enrutador Nova-3/Scribe v2; la diferencia entre los niveles es el límite de audio, el conjunto de salidas y la prioridad en la cola, no una promesa de precisión perfecta.

Donde Nova-3 supera visiblemente a los motores de reconocimiento de voz anteriores es en tres áreas: acentos regionales (inglés sudafricano, inglés indio, portugués brasileño), vocabulario técnico (nombres, direcciones, términos de productos que un modelo genérico malinterpretaría) y audio con cambio de código donde el hablante pasa entre idiomas dentro de una sola nota de voz. Esos son los modos de fallo específicos que motivaron la elección del motor. La conversión $29 Premium por chat no incluye transcripción en absoluto — conserva las notas de voz como referencias de marcador en el PDF sin pasar el audio por ningún modelo.

El flujo de trabajo es el siguiente: tu ZIP llega al servidor de ChatToPDF, se extraen los archivos de audio compatibles y cada nota se envía mediante HTTPS autenticado al proveedor elegido por el enrutador: Deepgram Nova-3 o ElevenLabs Scribe v2. Las transcripciones se reinsertan después en la conversación en las posiciones correctas antes de que se renderice el PDF.

Una elección deliberada en el flujo: no proceso ni recodifico el audio .opus compatible antes de la transcripción. Nova-3 y Scribe v2 aceptan Opus de forma nativa, por lo que el archivo fuente puede ir directamente al proveedor seleccionado sin una conversión previa a WAV o MP3.

Cobertura y precisión en 93 idiomas compatibles

Cuadrícula de los 93 idiomas compatibles con ChatToPDF, incluidos 57 en bandas de precisión alta o excelente

El registro actual de ChatToPDF cubre 93 idiomas; 57 figuran en bandas de precisión alta o excelente publicadas por el proveedor. Esas bandas sirven para planificar una revisión, no garantizan el resultado de una grabación concreta. Los idiomas que siguen son ejemplos importantes del conjunto y no la lista completa:

Ejemplos de cobertura: inglés, español, portugués, francés, alemán, italiano, árabe, hindi, indonesio, turco, ruso, neerlandés, japonés, coreano, chino, vietnamita y tailandés forman parte del registro actual. Las variantes regionales, los nombres propios, las cifras, el cambio intenso de idioma y el audio ruidoso requieren revisión contra el audio original; no publicamos una tasa de error fija para una lengua o una grabación concreta.

El enrutador combina el subconjunto compatible de Deepgram Nova-3 con la cobertura completa de ElevenLabs Scribe v2. Consulta el directorio de 93 idiomas de transcripción para ver la lista actual y las bandas publicadas. La cobertura no sustituye la revisión de nombres, números, dialectos, ruido o fragmentos que se vayan a citar.

El enrutamiento se realiza por nota. Un mismo chat puede contener notas en distintos idiomas compatibles, pero el cambio intenso de idioma dentro de una sola nota sigue siendo más difícil. Revisa especialmente los segmentos 50/50, los nombres propios y los importes contra el audio original.

Transcripción de ejemplo: nota de voz en español → texto (ejemplo real)

Nota de voz en español de WhatsApp renderizada como transcripción con nombre del hablante, marca de tiempo y texto

Esta es una nota de voz real de WhatsApp transcrita en el nivel de conversión $49 Premium+Voice por chat. El remitente era un hablante nativo de español colombiano, grabado en un dispositivo Android en un entorno interior tranquilo. Duración: 18 segundos. Tamaño del archivo: ~28 KB en formato .opus.

Audio original (resumido): Una nota de voz informal confirmando una cita al día siguiente, expresando preocupación por la salud de la otra persona y solicitando una respuesta por mensaje si los planes cambian.

Salida de transcripción en el PDF:

🎤 [Nota de voz — 0:18] "Hola, ¿cómo estás? Te llamo para confirmar la cita de mañana a las tres de la tarde. Si no puedes, mándame un mensaje. ¿Vale?"

El remitente se atribuye en el PDF con el nombre de _chat.txt, la marca de tiempo es la que WhatsApp registró cuando se envió la nota de voz, y la transcripción se sitúa en línea entre los mensajes de texto inmediatamente anteriores y posteriores en la conversación.

Algunos aspectos a observar en este ejemplo. El marcador de registro formal ¿Vale? — más cercano a "¿De acuerdo?" en significado — se transcribió correctamente en lugar de confundirse con bale u omitirse. La expresión temporal a las tres de la tarde se renderizó con precisión, lo que importa en una confirmación de cita donde un error sería engañoso. La entonación ascendente hablada en ¿cómo estás? no fue lo suficientemente ambigua como para producir un error de transcripción.

¿Dónde falla la precisión en español? Los errores más comunes que veo son homófonos: haya (subjuntivo de haber) frente a halla (de hallar), tubo frente a tuvo (pasado de tener). En el habla casual rápida, estos son fonéticamente idénticos. Nova-3 usa el contexto circundante para inferir la ortografía correcta la mayoría de las veces, pero no es perfecto. En un documento que se usará como registro legal, recomendaría una revisión humana ligera de cualquier nota de voz donde la transcripción se vaya a citar textualmente.

Si no necesitas transcripción en absoluto — por ejemplo, solo quieres que los mensajes de texto se conviertan a PDF y estás satisfecho con referencias de marcador para las notas de voz — la conversión $29 Premium por chat gestiona ese caso a un precio más bajo. La conversión $49 Premium+Voice por chat es el nivel adecuado cuando necesitas que el español hablado aparezca como texto legible en el documento.

Transcripción de ejemplo: hindi (hinglish mixto) → texto (ejemplo real)

Nota de voz en hindi-hinglish de WhatsApp renderizada como transcripción con cambio de código preservado

El cambio intenso de idioma dentro de una sola nota sigue siendo difícil para cualquier ruta. Nova-3 y Scribe v2 tienen coberturas distintas, por lo que los nombres, cifras y fragmentos citados deben compararse con el audio original en lugar de asumir una ventaja porcentual fija.

Esta es una transcripción real de la conversión $49 Premium+Voice por chat:

🎤 [Nota de voz — 0:22] "Yaar, kal meeting hai 3 baje, please attend karna. Project deadline aa rahi hai aur boss bahut strict hai."

Traducido: "Amigo, hay una reunión mañana a las 3, por favor asiste. La fecha límite del proyecto se acerca y el jefe es muy estricto."

El ejemplo de hinglish ilustra un caso de revisión, no un benchmark universal: palabras inglesas insertadas dentro de una frase hindi pueden conservarse o deformarse según la grabación y la ruta elegida. Conserva el audio y verifica las palabras importantes.

La diferencia importa cuando usas la transcripción como registro de trabajo. Si el responsable de alguien está revisando la transcripción de una nota de voz como documentación de un compromiso con el proyecto y la palabra deadline no aparece en el texto, eso no es un problema menor de precisión — es una pieza de información que falta.

La atribución del remitente usa _chat.txt: el nombre y la marca de tiempo de WhatsApp aparecen junto a la transcripción devuelta por el proveedor elegido.

Una nota específica sobre el hindi: si la nota de voz está en hindi dominado por devanagari (hindi formal con mínimas inserciones en inglés), la precisión es consistentemente sólida en todos los niveles compatibles. La conversión $49 Premium+Voice por chat es el punto de entrada correcto para cualquier nota de voz en hindi que quieras transcribir; la conversión $99 Power User por chat cubre la misma precisión sin límite de audio y con prioridad en la cola. La conversión $29 Premium por chat preserva las notas de voz solo como marcadores — no se ejecuta ninguna transcripción en ese nivel.

El nivel $49 Premium+Voice — qué incluye y qué no

Tarjeta Premium+Voice de $49 con enrutamiento y límite de 8 horas de audio

La conversión $49 Premium+Voice por chat es el nivel que construí específicamente para chats con muchas notas de voz. Esto es exactamente lo que incluye y lo que no.

Qué incluye la conversión $49 Premium+Voice por chat:

  • Enrutamiento con detección de idioma — cada nota compatible puede pasar por Deepgram Nova-3 o ElevenLabs Scribe v2
  • Un registro de 93 idiomas — 57 están en bandas publicadas de precisión alta o excelente; la cobertura no garantiza una grabación concreta
  • Hasta 8 horas de audio en un solo chat — cubre la gran mayoría de conversaciones con muchas notas de voz; si tu chat supera las 8 horas de audio grabado total, la conversión $99 Power User por chat elimina ese límite
  • Sin límite de mensajes — sin cota superior en el número de mensajes del chat que estás convirtiendo
  • Atribución del remitente en las transcripciones — cada transcripción en el PDF lleva el nombre del remitente de WhatsApp de los metadatos de la exportación
  • Marcas de tiempo preservadas — la marca de tiempo original de WhatsApp aparece junto a cada transcripción, no la hora de la transcripción
  • Tres formatos de salida — PDF, XLSX y CSV incluidos; el XLSX es útil si quieres filtrar u ordenar por remitente y marca de tiempo
  • Retención del archivo fuente durante 7 días — cifrado en reposo (AES-256), en tránsito (TLS 1.3)

Qué no incluye la conversión $49 Premium+Voice por chat:

  • Vocabulario especializado — el flujo actual no acepta un glosario personalizado por carga; nombres propios, acrónimos y términos raros deben revisarse con el audio original

El nivel por encima de este — conversión $99 Power User por chat — incluye todo lo de la conversión $49 Premium+Voice por chat más procesamiento en cola prioritaria y gestión masiva de chats. Si conviertes un solo chat y la velocidad no es crítica (la mayoría de las conversiones se completan en menos de tres minutos), la conversión $49 Premium+Voice por chat es el nivel adecuado.

Árbol de decisión que mapea necesidades de transcripción de voz al nivel de ChatToPDF adecuado por conversión de chat
Cinco niveles de precio de ChatToPDF desde $7 Basic hasta $99 Power User por chat, con el nivel de voz destacado

Como referencia, el conjunto completo de niveles: conversión $7 Basic por chat (solo texto, límite de 5.000 mensajes), conversión $14 Standard por chat (imágenes, límite de 25.000 mensajes), conversión $29 Premium por chat (sin límite de producto para mensajes, XLSX/CSV, notas de voz como marcadores), conversión $49 Premium+Voice por chat (enrutador de 93 idiomas, límite de 8 horas de audio) y conversión $99 Power User por chat (el mismo enrutador, sin límite de duración de audio y con cola prioritaria).

Por qué no transcribo en tiempo real (y no lo añadiré)

Comparación entre transcripción en tiempo real y asíncrona: latencia, precisión y coste de batería

Esto surge con suficiente frecuencia como para merecer una respuesta directa. La gente pregunta por qué ChatToPDF no escucha las notas de voz a medida que llegan — transcribiendo cada una en el momento en que se envía — en lugar de requerir una exportación ZIP después del hecho.

La versión corta: WhatsApp no da a los desarrolladores acceso a mensajes entrantes o audio en tiempo real. No hay ningún punto de acceso de la API oficial de WhatsApp Business que exponga las notas de voz a medida que llegan. El único acceso de terceros admitido es a través del mecanismo Exportar chat, que es una instantánea puntual del historial de conversación. Construir la transcripción en tiempo real sobre WhatsApp requeriría interceptar el almacenamiento local de la app en el dispositivo, lo que es tanto técnicamente frágil como contrario a las políticas de plataforma de WhatsApp.

Pero hay una razón más práctica por la que no he intentado construir alrededor de esa limitación. El caso de uso para transcribir WhatsApp audio es casi en su totalidad retrospectivo. Alguien recibe treinta notas de voz a lo largo de una disputa y quiere un registro legible. Un equipo empresarial usa notas de voz para actualizaciones del proyecto y necesita que sean buscables. Una familia se manda notas de voz durante años y quiere archivarlas antes de cambiar de teléfono. Ninguno de estos implica un requisito de "ahora mismo, a medida que llega". Todos son "tengo un conjunto de grabaciones que necesito convertir".

También está la cuestión de la batería y la red. Ejecutar una conexión WebSocket abierta que transmita fragmentos de audio a una API de inferencia en tiempo real consumiría batería del teléfono de forma notable durante una conversación larga. Requeriría una conexión a internet activa para cada nota de voz recibida, no solo cuando eliges convertir. Y crearía un flujo de datos continuo de tus conversaciones a un servidor de terceros — algo que no estoy cómodo pidiendo a los usuarios que acepten.

El modelo de exportación y subida es más lento en tiempo de reloj — tienes que esperar hasta que estés listo para convertir, luego hacer la exportación, luego subirla. Pero para los casos de uso reales que tiene la gente, eso está bien. Nadie intenta transcribir una nota de voz que recibió hace tres segundos para un documento en tiempo real. Están convirtiendo un chat que quieren conservar.

Privacidad: adónde va tu audio y adónde no

Flujo de privacidad: subida de audio, transcripción, almacenamiento cifrado y eliminación automática del archivo en 7 días

Quiero ser específico en esta parte porque la naturaleza de las notas de voz — grabaciones de audio de conversaciones reales — significa que las implicaciones para la privacidad son mayores que con solo mensajes de texto.

Este es el flujo exacto de datos para una nota de voz enviada a través de la conversión $49 Premium+Voice por chat:

Paso 1 — Subida. Tu archivo ZIP se transmite desde tu navegador al servidor de ChatToPDF por HTTPS (TLS 1.3). La conexión está cifrada en tránsito. El ZIP llega a un directorio de procesamiento temporal, no al almacenamiento permanente, mientras se ejecuta la extracción.

Paso 2 — Extracción. Los archivos .opus se extraen del ZIP. Cada archivo se empareja con su referencia en _chat.txt mediante el patrón del nombre del archivo. En este punto, los archivos de audio solo existen en el servidor de procesamiento de ChatToPDF.

Paso 3 — Llamada al proveedor de transcripción. Cada archivo compatible se envía mediante una llamada HTTPS autenticada al proveedor elegido para esa nota: Deepgram Nova-3 o ElevenLabs Scribe v2. Las solicitudes de Deepgram incluyen la exclusión del programa de mejora de modelos. El proveedor recibe el audio necesario para generar la transcripción, no el texto completo del chat.

Paso 4 — Almacenamiento. La transcripción se empaqueta en el PDF y se almacena cifrada en reposo (AES-256) en AWS S3. El ZIP fuente, incluidos los archivos .opus, también se almacena cifrado durante siete días.

Paso 5 — Entrega. El enlace de descarga del PDF aparece en pantalla y en tu correo electrónico. El enlace está vinculado a tu ID de trabajo. No es adivinable y no está indexado en ningún lugar.

Paso 6 — Eliminación automática. Siete días después de que se crea el trabajo, el ZIP fuente y el PDF resultante se eliminan del almacenamiento automáticamente. Este es un trabajo de eliminación programado, no un proceso manual. No hay excepciones ni extensiones.

Adónde no va tu audio: no va a ninguna plataforma de análisis. No se usa para entrenar los modelos de ChatToPDF (ChatToPDF no entrena modelos). El contenido de texto de tus notas de voz no es visible para el personal de ChatToPDF — el procesamiento es completamente automatizado. Ningún tercero recibe el texto de tus mensajes de chat.

El paso externo merece atención en cualquier revisión de privacidad. ChatToPDF controla su propio flujo, pero Deepgram y ElevenLabs controlan sus procesos según sus términos. Si las notas contienen información privilegiada, regulada o muy sensible, el equipo responsable debe revisar las condiciones actuales de ambos proveedores antes de subirlas.

Casos extremos: ruido de fondo, varios hablantes, efectos de voz

Gráfico de precisión de transcripción por nivel de ruido: estudio, silencioso, sala concurrida, exterior y llamada móvil

Las notas de voz reales de WhatsApp no se graban en estudios insonorizados. Se graban en coches, cocinas, reuniones en la calle y cafés ruidosos. Así afecta cada uno de esos escenarios a la precisión de la transcripción, y qué hace ChatToPDF cuando la precisión cae a un nivel inaceptable.

Ruido de fondo según el entorno.

Una nota de voz grabada en un entorno interior tranquilo — una oficina, un dormitorio, una habitación en silencio — suele ser más fácil de transcribir que una nota con ruido, clipping, varias voces o cambios de idioma. La banda publicada de un idioma no predice el resultado de esa nota concreta.

Varios hablantes dentro de una sola nota de voz.

Si se oye otra persona de fondo, el proveedor elegido puede transcribir también esa voz. El resultado puede mezclar ambas voces bajo el remitente de WhatsApp, así que revisa esos clips contra el audio.

ChatToPDF actualmente no puede aislar al hablante principal y descartar las voces de fondo dentro de un único clip .opus. La diarización de hablantes — identificar qué segmentos de audio provinieron de qué persona en el mismo archivo de audio — es una función que estoy evaluando para un nivel futuro, pero requiere infraestructura adicional y no está en la versión actual.

Efectos de cambio de voz.

Para los clips donde la confianza cae por debajo del umbral que he establecido en el flujo — actualmente definido como una puntuación de confianza de palabras promedio inferior a 0,6 en todo el clip — ChatToPDF marca la transcripción en el PDF como [transcripción de baja confianza — calidad de audio insuficiente] en lugar de producir un bloque de texto que podría tomarse como autorizado. Verás este marcador en el PDF final junto a la posición de la nota de voz en la conversación. Es mejor señalar un resultado incierto que devolver una transcripción de aspecto plausible que sea un 40% incorrecta.

Preguntas frecuentes

¿Qué formato de archivo usan las notas de voz de WhatsApp y lo gestiona ChatToPDF?

WhatsApp suele guardar las notas de voz como audio Opus en archivos .opus. ChatToPDF extrae el audio compatible del ZIP de exportación y envía cada nota en su formato nativo a Deepgram Nova-3 o ElevenLabs Scribe v2, según el enrutador; no se requiere una recodificación previa.

¿Qué precisión tiene la transcripción de audio de WhatsApp?

La precisión depende sobre todo de la grabación. Las conversiones $49 Premium+Voice y $99 Power User usan el mismo enrutador Nova-3/Scribe v2; Power User cambia el límite de audio y la prioridad, no garantiza más precisión. La conversión $29 Premium no transcribe. El ruido, las voces superpuestas, el clipping, los acentos, los dialectos y el cambio de idioma pueden reducir la calidad, así que verifica nombres, fechas, importes y citas contra el audio original.

¿Transcribe ChatToPDF notas de voz en idiomas distintos al inglés?

Sí. Las conversiones $49 Premium+Voice y $99 Power User usan un enrutador con detección de idioma entre Deepgram Nova-3 y ElevenLabs Scribe v2 para el registro actual de 93 idiomas; 57 están en bandas publicadas de precisión alta o excelente. Scribe v2 cubre el registro completo y Nova-3 su subconjunto compatible. La cobertura no garantiza cada dialecto o grabación. La conversión $29 Premium no transcribe notas de voz.

¿Necesito hacer algo diferente al exportar desde WhatsApp si quiero transcripciones de voz?

Sí — un paso crítico. Cuando exportas tu chat desde WhatsApp, elige "Incluir archivos multimedia" en lugar de "Sin archivos multimedia". Las notas de voz (archivos .opus) solo se incluyen en la exportación cuando seleccionas Incluir archivos multimedia. Si exportas Sin archivos multimedia, el _chat.txt contendrá referencias como <attached: 00000012-AUDIO-2024-03-15-09-22-31.opus> pero sin archivos de audio reales. ChatToPDF no puede transcribir una nota de voz que no tiene. Consulta la guía de exportación de chat de WhatsApp para el proceso completo de exportación paso a paso.

¿Aparecerán las transcripciones de voz en el lugar correcto del PDF?

Sí. ChatToPDF lee el registro de mensajes en _chat.txt para entender la estructura de la conversación, empareja cada referencia .opus con el archivo de audio correspondiente por nombre de archivo e inserta la transcripción en la posición exacta de la conversación donde se envió la nota de voz. El nombre del remitente de los metadatos de WhatsApp y la marca de tiempo original aparecen junto a la transcripción. La salida es un único documento donde los mensajes de texto y las transcripciones de notas de voz se alternan en el orden cronológico correcto.

¿Qué ocurre con mis archivos de audio una vez completada la transcripción?

Los archivos de audio se almacenan cifrados en reposo en el trabajo de ChatToPDF y se envían solo al proveedor seleccionado para esa nota: Deepgram o ElevenLabs. Las solicitudes de Deepgram excluyen el audio de su programa de mejora de modelos. La eliminación de archivos fuente, audio extraído y descargas se programa al alcanzar siete días; un trabajo aún en proceso puede recibir una prórroga limitada de hasta 24 horas. Consulta la sección de privacidad de WhatsApp a PDF.

¿Puede ChatToPDF distinguir a dos personas diferentes hablando en la misma nota de voz?

Actualmente no. Cada nota de voz de WhatsApp se atribuye a la persona que la envió, usando la información del remitente de _chat.txt. Dentro de una sola nota de voz, si el remitente y otra persona hablan (por ejemplo, el remitente está teniendo una conversación telefónica mientras graba), ambas voces se transcriben pero se atribuyen al remitente de WhatsApp. ChatToPDF actualmente no ejecuta diarización de hablantes dentro de clips de audio individuales. Para notas de voz donde las voces de fondo son audibles e inteligibles, podrías ver habla intercalada en la transcripción.

Cinco niveles de precio de ChatToPDF desde $7 Basic hasta $99 Power User por chat, con el nivel de voz destacado

Para el flujo completo de chat a PDF — incluyendo cómo exportar en iPhone y Android, qué contiene el ZIP y cómo se comparan los cinco niveles para conversiones sin voz — consulta la guía de WhatsApp a PDF. Si estás en Android y necesitas mover la exportación a otro dispositivo antes de subirla, la guía de transferencia de WhatsApp Android a iPhone cubre ese proceso.

Paul · ChatToPDF

I'm Paul, the founder of ChatToPDF. I built it after needing a long WhatsApp conversation as a readable PDF for a legal matter. I test and document WhatsApp exports, PDF conversion, voice-note transcription, and the limits people should check before relying on the result.

Published 2026-05-12