Ce que signifie réellement « transcrire un audio WhatsApp » (et pourquoi c'est plus difficile qu'il n'y paraît)
Les gens emploient l'expression « transcrire un audio WhatsApp » pour au moins trois choses différentes. Certains veulent transcrire des appels vocaux en direct — que WhatsApp n'expose via aucune API développeur et qui constituent techniquement une catégorie de produit distincte de ce que je décris ici. D'autres veulent convertir des fichiers audio sauvegardés depuis WhatsApp en texte, en traitant le fichier .opus comme une entrée autonome. Et d'autres — le groupe le plus nombreux — veulent que chaque note vocale à l'intérieur d'un chat WhatsApp exporté soit convertie en texte lisible pour que toute la conversation ait du sens comme document.
ChatToPDF est conçu pour ce troisième cas d'usage — and I built it specifically because I ran into this problem myself. Le problème qu'il résout est précis : vous exportez un chat WhatsApp contenant à la fois des messages texte et des notes vocales, et ce que vous récupérez de WhatsApp est un ZIP contenant un _chat.txt et un dossier de fichiers médias. Le _chat.txt contient des lignes comme <attached: 00000012-AUDIO-2024-03-15-09-22-31.opus> là où la note vocale devrait être. Rien ne convertit ces lignes en texte lisible à moins que vous construisiez quelque chose pour le faire.
Voici ce que personne ne vous dit : même quand les gens trouvent un outil de transcription, ils rencontrent souvent un problème structurel. Les outils gérant des fichiers audio génériques — importez un MP3, obtenez du texte — ne savent pas où dans une conversation cet audio se situe. Ils transcrivent le fichier mais perdent le contexte. Vous vous retrouvez avec un bloc de texte séparé sans nom d'expéditeur, sans horodatage, sans indication de ce qui a été dit avant ou après. Pour une affaire juridique, un dossier professionnel ou une archive familiale, ce contexte est tout l'enjeu.
Ce que j'ai construit fait ceci : il lit le _chat.txt pour comprendre la structure de la conversation, associe chaque référence .opus au fichier audio correct dans le ZIP, transcrit l'audio et insère la transcription exactement à la bonne position dans la conversation — avec le nom de l'expéditeur et l'horodatage original préservés. Le résultat est un seul PDF où messages texte et transcriptions de notes vocales alternent naturellement, exactement comme la conversation s'est déroulée.
C'est le problème qu'aborde ce guide.
Les notes vocales ne sont pas des fichiers — elles sont un flux interne

Les notes vocales WhatsApp ressemblent à des fichiers audio dans l'application — une barre de forme d'onde, une durée, un bouton de lecture — mais elles ne sont pas stockées comme la plupart des gens l'imaginent. Quand vous enregistrez une note vocale dans WhatsApp en tenant le bouton microphone, WhatsApp encode l'audio avec le codec Opus et le sauvegarde sous forme de fichier .opus dans un répertoire privé sur votre appareil. Ce répertoire n'est pas accessible via la navigation normale de fichiers sur iPhone ou Android. Vous ne pouvez pas naviguer vers lui dans l'app Fichiers et y trouver vos notes vocales.
Le seul moyen d'extraire ces fichiers .opus est via le menu Exporter le chat de WhatsApp, avec « Inclure les médias » sélectionné. Quand vous exportez ainsi, WhatsApp emballe le journal de messages _chat.txt avec le dossier médias — et c'est là qu'apparaissent les fichiers .opus. Sur iOS, ils se retrouvent dans le ZIP. Sur Android, les anciennes versions de WhatsApp exportaient dans un dossier du stockage interne ; les versions récentes créent un ZIP via la feuille de partage, reproduisant le comportement iOS.
Opus est conçu pour transporter efficacement la voix, mais un export n'a pas une fréquence d'échantillonnage, un débit ni une taille de fichier universels. WhatsApp peut produire différents fichiers ou conteneurs selon le type de message, l'appareil et la version. Pour une analyse exacte, inspectez le fichier réel avec VLC ou ffprobe ; le bruit, la distance au microphone et les voix superposées influencent davantage la transcription que l'extension seule.
C'est pourquoi le routage et la relecture comptent. ChatToPDF envoie chaque fichier pris en charge vers le fournisseur approprié sans promettre un réglage fixe ni une précision identique pour tous les enregistrements.
Un dernier point structurel : chaque note vocale WhatsApp est un enregistrement d'un seul expéditeur. Le modèle push-to-talk de WhatsApp signifie qu'une personne enregistre, puis s'arrête, puis l'autre enregistre sa réponse. C'est en fait un avantage pour la transcription — contrairement à un appel téléphonique enregistré où deux voix se chevauchent sur la même piste audio, chaque fichier .opus dans un export WhatsApp appartient exactement à un expéditeur. ChatToPDF exploite les métadonnées du _chat.txt pour attribuer chaque transcription à la bonne personne, ce qui permet d'obtenir une conversation lisible même quand les deux interlocuteurs alternent les notes vocales.
Comment le routeur choisit le moteur de transcription

ChatToPDF ne dépend plus d'un seul moteur. Le parcours actuel choisit pour chaque note entre Deepgram Nova-3 et ElevenLabs Scribe v2 selon la langue prise en charge et la disponibilité du fournisseur. Nova-3 couvre son sous-ensemble de langues ; Scribe v2 étend le registre complet à 93 langues et peut aussi servir de parcours alternatif.
Whisper est impressionnant pour un modèle gratuit, mais j'ai effectué des tests de précision sur un ensemble de fichiers .opus WhatsApp réels en anglais, espagnol, hindi et arabe, et il a montré des faiblesses constantes sur le changement de code (une note vocale mélangeant deux langues en milieu de phrase) et sur les accents anglais non américains. Il n'offre pas non plus de SLA commerciaux ni de garanties de disponibilité, ce qui compte quand des utilisateurs payants attendent leur résultat.
AssemblyAI est une option sérieuse et a été utilisée dans un premier prototype. Le parcours de production actuel combine Deepgram Nova-3 et ElevenLabs Scribe v2 afin d'élargir la couverture linguistique et de disposer d'une voie alternative selon la langue prise en charge et la disponibilité.
Deepgram Nova-3 reste l'un des parcours de production, mais ce n'est pas le seul. Les conversions $49 Premium+Voice et $99 Power User utilisent le même routeur Nova-3/Scribe v2 ; elles diffèrent par la limite audio, le lot de sorties et la priorité de file, pas par une promesse de précision parfaite.
Là où Nova-3 surpasse visiblement les anciens moteurs de reconnaissance vocale, c'est dans trois domaines : les accents régionaux (anglais sud-africain, anglais indien, portugais brésilien), le vocabulaire technique (noms, adresses, termes de produits qu'un modèle générique mal entendrait) et l'audio avec changement de code où un locuteur passe d'une langue à l'autre dans une seule note vocale. Ce sont les modes d'échec spécifiques qui ont motivé le choix du moteur. La conversion $29 Premium par chat n'inclut aucune transcription — elle préserve les notes vocales comme références dans le PDF sans passer l'audio dans aucun modèle.
Le pipeline fonctionne ainsi : votre ZIP arrive sur le serveur de ChatToPDF, les fichiers audio pris en charge sont extraits et chaque note est envoyée par HTTPS authentifié au fournisseur choisi par le routeur : Deepgram Nova-3 ou ElevenLabs Scribe v2. Les transcriptions sont ensuite replacées dans la conversation aux bonnes positions avant le rendu du PDF.
Un choix délibéré dans le pipeline : l'audio .opus pris en charge n'est ni prétraité ni réencodé avant la transcription. Nova-3 et Scribe v2 acceptent Opus nativement, de sorte que le fichier source peut aller directement au fournisseur sélectionné sans conversion préalable en WAV ou MP3.
Couverture et précision sur 93 langues prises en charge

Le registre actuel de ChatToPDF couvre 93 langues ; 57 figurent dans des bandes de précision haute ou excellente publiées par le fournisseur. Ces bandes aident à planifier la relecture, mais ne garantissent pas le résultat d'un enregistrement. Les langues ci-dessous sont des exemples importants, pas la liste complète :
Exemples de couverture : l'anglais, l'espagnol, le portugais, le français, l'allemand, l'italien, l'arabe, l'hindi, l'indonésien, le turc, le russe, le néerlandais, le japonais, le coréen, le chinois, le vietnamien et le thaï font partie du registre actuel. Les variantes régionales, les noms propres, les nombres, les changements fréquents de langue et les enregistrements bruyants doivent être vérifiés avec l'audio d'origine ; nous ne publions pas un taux d'erreur fixe pour une langue ou un enregistrement donné.
Le routeur combine le sous-ensemble pris en charge par Deepgram Nova-3 avec la couverture complète d'ElevenLabs Scribe v2. Consultez le répertoire des 93 langues de transcription pour la liste actuelle et les bandes publiées. La couverture ne remplace pas la vérification des noms, nombres, dialectes, bruits ou passages cités.
Le routage se fait note par note. Un même chat peut contenir des notes dans plusieurs langues prises en charge, mais un fort changement de langue à l'intérieur d'une seule note reste plus difficile. Vérifiez particulièrement les passages 50/50, les noms propres et les montants par rapport à l'audio original.
Exemple de transcription : note vocale en espagnol → texte (exemple réel)

Voici une note vocale WhatsApp réelle transcrite au niveau $49 Premium+Voice par conversion de chat. Le locuteur était un natif espagnol colombien, enregistré sur un appareil Android dans un environnement intérieur calme. Durée : 18 secondes. Taille du fichier : ~28 Ko au format .opus.
Audio original (paraphrasé) : Une note vocale informelle confirmant un rendez-vous le lendemain, exprimant une inquiétude pour la santé de l'autre personne et demandant un message texte si les plans changent.
Sortie de transcription dans le PDF :
🎤 [Note vocale — 0:18] "Hola, ¿cómo estás? Te llamo para confirmar la cita de mañana a las tres de la tarde. Si no puedes, mándame un mensaje. ¿Vale?"
L'expéditeur est attribué dans le PDF avec le nom du _chat.txt, l'horodatage est celui que WhatsApp a enregistré quand la note vocale a été envoyée, et la transcription se trouve en ligne entre les messages texte immédiatement avant et après elle dans la conversation.
Quelques éléments à noter dans cet exemple. Le marqueur de registre formel ¿Vale? — plus proche de « D'accord ? » en sens — a été transcrit correctement plutôt que confondu avec bale ou omis. L'expression temporelle a las tres de la tarde (« à trois heures de l'après-midi ») a été rendue avec précision, ce qui compte pour une confirmation de rendez-vous où une erreur serait trompeuse.
Où la précision en espagnol se dégrade-t-elle ? Les erreurs les plus courantes que je vois sont des homophones : haya (subjonctif de haber) versus halla (de hallar, trouver), tubo (tube) versus tuvo (passé de tener). Dans la parole rapide et informelle, ils sont phonétiquement identiques. Nova-3 exploite le contexte environnant pour inférer l'orthographe correcte la plupart du temps, mais ce n'est pas parfait. Pour un document servant de dossier juridique, je recommande une légère relecture humaine de toute note vocale dont la transcription sera citée verbatim.
Si vous n'avez pas besoin de transcription — par exemple, vous voulez seulement les messages texte en PDF et vous acceptez des références pour les notes vocales — la conversion $29 Premium par chat gère ce cas à un tarif inférieur. La conversion $49 Premium+Voice par chat est le bon niveau suivant quand vous avez besoin que l'espagnol parlé apparaisse comme texte lisible dans le document.
Exemple de transcription : hindi (hinglish mélangé) → texte (exemple réel)

Un changement de langue important au sein d'une même note reste difficile quelle que soit la voie. Nova-3 et Scribe v2 ont des couvertures différentes ; noms, nombres et passages cités doivent être vérifiés avec l'audio original plutôt que rattachés à un avantage chiffré fixe.
Voici une transcription réelle de la conversion $49 Premium+Voice par chat :
🎤 [Note vocale — 0:22] "Yaar, kal meeting hai 3 baje, please attend karna. Project deadline aa rahi hai aur boss bahut strict hai."
Traduit : « Mon pote, il y a une réunion demain à 3 heures, viens s'il te plaît. La date limite du projet approche et le patron est très strict. »
L'exemple Hinglish illustre un cas à relire, pas un benchmark universel : les mots anglais insérés dans une phrase hindi peuvent être conservés ou déformés selon l'enregistrement et la voie choisie. Conservez l'audio et vérifiez les termes importants.
La différence compte quand on recourt à la transcription comme dossier de travail. Si un manager examine une transcription de note vocale comme documentation d'un engagement de projet et que le mot deadline n'apparaît pas dans le texte, ce n'est pas une simple querelle de précision — c'est une information manquante.
L'attribution de l'expéditeur vient de _chat.txt : le nom et l'horodatage WhatsApp apparaissent avec la transcription renvoyée par le fournisseur choisi.
Une remarque sur le hindi spécifiquement : si la note vocale est en hindi à dominante Devanagari (hindi formel de style discours écrit avec peu d'anglais), la précision est constamment forte sur les niveaux pris en charge. La conversion $49 Premium+Voice par chat est le bon point d'entrée pour toute note vocale en hindi à transcrire ; la conversion $99 Power User par chat couvre la même précision sans plafond audio et avec priorité de file. La conversion $29 Premium par chat préserve les notes vocales comme références uniquement — aucune transcription ne s'exécute à ce niveau.
Le niveau $49 Premium+Voice — ce qu'il inclut et ce qu'il n'inclut pas

La conversion $49 Premium+Voice par chat est le niveau que j'ai créé spécifiquement pour les chats riches en notes vocales. Voici exactement ce qu'il inclut et ce qu'il n'inclut pas.
Ce qu'inclut la conversion $49 Premium+Voice par chat :
- Routage sensible à la langue — chaque note prise en charge peut passer par Deepgram Nova-3 ou ElevenLabs Scribe v2
- Un registre de 93 langues — 57 sont dans des bandes publiées de précision haute ou excellente ; la couverture ne garantit pas un enregistrement précis
- Jusqu'à 8 heures d'audio dans un seul chat — couvre la grande majorité des conversations riches en notes vocales ; si votre chat dépasse 8 heures d'audio total enregistré, la conversion $99 Power User par chat lève ce plafond
- Pas de plafond de messages — aucune limite supérieure sur le nombre de messages dans le chat converti
- Attribution de l'expéditeur sur les transcriptions — chaque transcription dans le PDF porte le nom d'expéditeur WhatsApp issu des métadonnées d'export
- Horodatages préservés — l'horodatage WhatsApp original apparaît à côté de chaque transcription, pas l'heure de transcription
- Trois formats de sortie — PDF, XLSX et CSV tous inclus ; le XLSX est utile pour filtrer ou trier par expéditeur et horodatage
- Conservation du fichier source pendant sept jours — chiffré au repos (AES-256), en transit (TLS 1.3)
Ce qui n'est pas inclus dans la conversion $49 Premium+Voice par chat :
- Vocabulaire spécialisé — le flux actuel n'accepte pas de glossaire personnalisé par import ; noms propres, acronymes et termes rares doivent être vérifiés avec l'audio original
Le niveau au-dessus — $99 Power User par chat — inclut tout ce qui est dans $49 Premium+Voice par chat plus le traitement en file prioritaire et la gestion de chats en masse. Si vous convertissez un seul chat et que la vitesse n'est pas critique (la plupart des conversions se terminent en moins de trois minutes), la conversion $49 Premium+Voice par chat est le bon niveau.


Pour référence, la pile complète des niveaux : $7 Basic par conversion de chat (texte uniquement, plafond de 5 000 messages), $14 Standard par conversion de chat (images, plafond de 25 000 messages), $29 Premium par conversion de chat (pas de plafond produit sur les messages, XLSX/CSV, notes vocales préservées comme références), $49 Premium+Voice par conversion de chat (routeur de 93 langues, plafond de 8 heures audio) et $99 Power User par conversion de chat (même routeur, sans limite de durée audio et file prioritaire).
Pourquoi je ne transcris pas en temps réel (et ne le ferai pas)

Cela revient assez souvent pour mériter une réponse directe. Les gens demandent pourquoi ChatToPDF n'écoute pas les notes vocales à leur arrivée — en transcrivant chacune dès qu'elle est envoyée — plutôt que de nécessiter un export ZIP après coup.
La version courte : WhatsApp ne donne pas aux développeurs accès aux messages entrants ni à l'audio en temps réel. Il n'existe aucun point de terminaison officiel de l'API WhatsApp Business qui expose les notes vocales à leur arrivée. Le seul chemin d'accès tiers pris en charge est via le mécanisme Exporter le chat, qui est un instantané ponctuel de l'historique de la conversation. Construire une transcription en temps réel au-dessus de WhatsApp nécessiterait d'intercepter le stockage local de l'application sur l'appareil, ce qui est à la fois techniquement fragile et hors des conditions d'utilisation de la plateforme WhatsApp.
Mais il y a une raison plus pratique pour laquelle je n'ai pas essayé de contourner cette contrainte. Le cas d'usage pour la transcription audio WhatsApp est presque entièrement rétrospectif. Quelqu'un reçoit trente notes vocales au cours d'un litige et veut un dossier lisible. Une équipe d'affaires emploie des notes vocales pour des mises à jour de projet et a besoin qu'elles soient consultables. Une famille envoie des notes vocales depuis des années et veut les archiver avant un changement de téléphone. Aucun de ces cas n'implique une exigence de « maintenant, à la réception ». Ils relèvent tous de « j'ai un ensemble d'enregistrements à convertir ».
Il y a aussi la question de la batterie et du réseau. Maintenir une connexion WebSocket ouverte qui diffuse des fragments audio vers une API d'inférence en temps réel viderait sensiblement la batterie d'un téléphone sur une longue conversation. Cela nécessiterait une connexion internet active pour chaque note vocale reçue, pas seulement quand vous choisissez de convertir. Et cela créerait un flux continu de données de vos conversations vers un serveur tiers — ce que je ne suis pas à l'aise de demander aux utilisateurs d'accepter.
Le modèle export-et-import est plus lent en temps horloge — vous devez attendre d'être prêt à convertir, puis exécuter l'export, puis importer. Mais pour les cas d'usage réels des gens, c'est acceptable. Personne ne cherche à transcrire une note vocale reçue il y a trois secondes pour un document en temps réel. Ils convertissent un chat qu'ils veulent conserver.
Confidentialité : où va votre audio et où il ne va pas

C'est la partie sur laquelle je veux être précis parce que la nature des notes vocales — des enregistrements audio de conversations réelles — signifie que les enjeux de confidentialité sont plus élevés qu'avec les seuls messages texte.
Voici le chemin exact des données pour une note vocale soumise via la conversion $49 Premium+Voice par chat :
Étape 1 — Importation. Votre fichier ZIP est transmis de votre navigateur au serveur de ChatToPDF via HTTPS (TLS 1.3). La connexion est chiffrée en transit. Le ZIP arrive dans un répertoire de traitement temporaire, pas dans le stockage permanent, pendant que l'extraction s'exécute.
Étape 2 — Extraction. Les fichiers .opus sont extraits du ZIP. Chaque fichier est associé à sa référence _chat.txt par le motif du nom de fichier. À ce stade, les fichiers audio n'existent que sur le serveur de traitement de ChatToPDF.
Étape 3 — Appel au fournisseur de transcription. Chaque fichier pris en charge est envoyé par HTTPS authentifié au fournisseur choisi pour cette note : Deepgram Nova-3 ou ElevenLabs Scribe v2. Les requêtes Deepgram incluent l'exclusion du programme d'amélioration des modèles. Le fournisseur reçoit l'audio nécessaire à la transcription, pas le texte complet du chat.
Étape 4 — Stockage. La transcription est intégrée dans le PDF et stockée chiffrée au repos (AES-256) dans AWS S3. Le ZIP source, incluant les fichiers .opus, est également stocké chiffré pendant sept jours.
Étape 5 — Livraison. Le lien de téléchargement du PDF apparaît à l'écran et dans votre e-mail. Le lien est lié à votre identifiant de tâche. Il ne peut pas être deviné et n'est indexé nulle part.
Étape 6 — Suppression automatique. Sept jours après la création de la tâche, le ZIP source et le PDF de sortie sont supprimés automatiquement du stockage. C'est une tâche de suppression planifiée, pas un processus manuel. Pas d'exceptions et pas de prolongations.
Où votre audio ne va pas : il ne va pas vers une plateforme d'analyse. Il n'est pas utilisé pour entraîner les modèles de ChatToPDF (ChatToPDF n'entraîne pas de modèles). Le contenu textuel de vos notes vocales n'est pas visible par le personnel de ChatToPDF — le traitement est entièrement automatisé. Aucun tiers ne reçoit le texte de vos messages de chat.
L'étape externe doit figurer dans toute analyse de confidentialité. ChatToPDF contrôle son propre pipeline, mais Deepgram et ElevenLabs contrôlent leur traitement selon leurs conditions respectives. Si les notes contiennent des informations privilégiées, réglementées ou très sensibles, l'équipe responsable doit examiner les conditions actuelles des deux fournisseurs avant l'importation.
Cas particuliers : bruit de fond, plusieurs locuteurs, effets vocaux

Les vraies notes vocales WhatsApp ne sont pas enregistrées dans des studios insonorisés. Elles sont enregistrées dans des voitures, des cuisines, des réunions de rue et des cafés bruyants. Voici comment chacun de ces scénarios affecte la précision de la transcription, et ce que ChatToPDF fait quand la précision tombe à un niveau inacceptable.
Bruit de fond selon l'environnement.
Une note vocale enregistrée dans un environnement intérieur calme est généralement plus facile à transcrire qu'une note avec bruit, écrêtage, plusieurs voix ou changements de langue. La bande publiée d'une langue ne prédit pas le résultat d'un enregistrement particulier.
Plusieurs locuteurs dans une seule note vocale.
Si une autre personne parle audiblement en arrière-plan, le fournisseur choisi peut également transcrire cette voix. Le résultat peut mêler les deux voix sous l'expéditeur WhatsApp ; vérifiez ces passages avec l'audio.
ChatToPDF ne peut pas actuellement isoler le locuteur principal et rejeter les voix de fond dans un seul clip .opus. La diarisation des locuteurs — identifier quels segments audio viennent de quelle personne dans le même fichier audio — est une fonctionnalité que j'évalue pour un futur niveau, mais elle nécessite une infrastructure supplémentaire et n'est pas dans la version actuelle.
Effets vocaux.
Pour les clips où la confiance tombe en dessous du seuil que j'ai fixé dans le pipeline — actuellement défini comme un score de confiance de mot moyen inférieur à 0,6 sur le clip — ChatToPDF marque la transcription dans le PDF comme [transcription à faible confiance — qualité audio insuffisante] plutôt que de produire un bloc de texte qui pourrait être pris pour autorité. Vous verrez ce marqueur dans le PDF final à côté de la position de la note vocale dans la conversation. Il vaut mieux signaler un résultat incertain que de retourner une transcription vraisemblable mais incorrecte à 40 %.
FAQ
Quel format de fichier les notes vocales WhatsApp adoptent-elles, et ChatToPDF le gère-t-il ?
WhatsApp enregistre généralement les notes vocales au format audio Opus dans des fichiers .opus. ChatToPDF extrait l'audio pris en charge du ZIP d'export et envoie chaque note dans son format natif à Deepgram Nova-3 ou ElevenLabs Scribe v2 selon le routeur ; aucun réencodage préalable n'est nécessaire.
Quelle est la précision de la transcription audio WhatsApp ?
La précision dépend surtout de l'enregistrement. Les conversions $49 Premium+Voice et $99 Power User utilisent le même routeur Nova-3/Scribe v2 ; Power User change la limite audio et la priorité, sans garantir une précision supérieure. La conversion $29 Premium ne transcrit pas. Bruit, voix superposées, écrêtage, accents, dialectes et changements de langue peuvent réduire la qualité ; vérifiez les noms, dates, montants et citations avec l'audio original.
ChatToPDF transcrit-il les notes vocales dans des langues autres que l'anglais ?
Oui. Les conversions $49 Premium+Voice et $99 Power User utilisent un routeur sensible à la langue entre Deepgram Nova-3 et ElevenLabs Scribe v2 pour le registre actuel de 93 langues ; 57 figurent dans des bandes publiées de précision haute ou excellente. Scribe v2 couvre tout le registre et Nova-3 son sous-ensemble pris en charge. La couverture ne garantit pas chaque dialecte ou enregistrement. La conversion $29 Premium ne transcrit pas les notes vocales.
Dois-je faire quelque chose de différent lors de l'export depuis WhatsApp si je veux des transcriptions vocales ?
Oui — une étape critique. Quand vous exportez votre chat depuis WhatsApp, choisissez « Inclure les médias » plutôt que « Sans médias ». Les notes vocales (fichiers .opus) ne sont incluses dans l'export que quand vous sélectionnez Inclure les médias. Si vous exportez Sans médias, le _chat.txt contiendra des références comme <attached: 00000012-AUDIO-2024-03-15-09-22-31.opus> mais aucun fichier audio réel. ChatToPDF ne peut pas transcrire une note vocale qu'il n'a pas. Consultez le guide d'export de chat WhatsApp pour le processus d'export étape par étape.
Les transcriptions vocales apparaissent-elles au bon endroit dans le PDF ?
Oui. ChatToPDF lit le journal des messages dans _chat.txt pour comprendre la structure de la conversation, associe chaque référence .opus au fichier audio correspondant par nom de fichier, et insère la transcription exactement à la position dans la conversation où la note vocale a été envoyée. Le nom de l'expéditeur issu des métadonnées WhatsApp et l'horodatage original apparaissent tous les deux à côté de la transcription. Le résultat est un document unique où messages texte et transcriptions de notes vocales alternent dans le bon ordre chronologique.
Qu'arrive-t-il à mes fichiers audio après la transcription ?
Les fichiers audio sont stockés chiffrés dans la tâche ChatToPDF et envoyés uniquement au fournisseur sélectionné pour cette note : Deepgram ou ElevenLabs. Les requêtes Deepgram excluent le programme d'amélioration des modèles. La suppression des fichiers sources, de l'audio extrait et des téléchargements est planifiée à sept jours ; une tâche encore en traitement peut bénéficier d'une prolongation limitée à 24 heures. Consultez la section confidentialité du guide WhatsApp to PDF.
ChatToPDF peut-il distinguer deux personnes différentes parlant dans la même note vocale ?
Pas actuellement. Chaque note vocale WhatsApp est attribuée à la personne qui l'a envoyée, en utilisant les informations d'expéditeur du _chat.txt. Dans une seule note vocale, si l'expéditeur et une autre personne parlent tous les deux (par exemple, l'expéditeur est en conversation téléphonique en enregistrant), les deux voix sont transcrites mais attribuées à l'expéditeur WhatsApp. ChatToPDF n'exécute pas actuellement la diarisation des locuteurs dans les clips audio individuels. Pour les notes vocales où des voix de fond sont audibles et intelligibles, vous pouvez voir de la parole entremêlée dans la transcription.

Pour le flux complet chat-vers-PDF — incluant comment exporter sur iPhone et Android, ce que le ZIP contient et comment les cinq niveaux se comparent pour les conversions sans voix — consultez le guide WhatsApp to PDF. Si vous êtes sur Android et que vous devez déplacer l'export vers un autre appareil avant de l'importer, le guide de transfert WhatsApp Android vers iPhone couvre ce processus.
I'm Paul, the founder of ChatToPDF. I built it after needing a long WhatsApp conversation as a readable PDF for a legal matter. I test and document WhatsApp exports, PDF conversion, voice-note transcription, and the limits people should check before relying on the result.

