Was "transcribe WhatsApp audio" wirklich bedeutet (und warum es schwieriger ist als es klingt)
Menschen verwenden den Begriff "transcribe WhatsApp audio" für mindestens drei verschiedene Dinge. Einige wollen Live-Sprachanrufe transkribieren – die WhatsApp über keine Entwickler-API zugänglich macht und die technisch eine andere Produktkategorie darstellen als das, was ich hier beschreibe. Einige wollen aus WhatsApp gespeicherte Audiodateien in Text umwandeln, die .opus-Datei als eigenständige Eingabe behandelnd. Und einige – die größte Gruppe – wollen, dass jede Sprachnachricht in einem exportierten WhatsApp-Chat in lesbaren Text umgewandelt wird, damit das gesamte Gespräch als Dokument Sinn ergibt.
ChatToPDF ist für diesen dritten Anwendungsfall gebaut (my solution, built after running into this exact problem myself). Das Problem, das es löst, ist spezifisch: Man exportiert einen WhatsApp-Chat, der sowohl Textnachrichten als auch Sprachnachrichten enthält, und was man von WhatsApp zurückbekommt, ist ein ZIP mit einer _chat.txt und einem Ordner von Mediendateien. Die _chat.txt hat Zeilen wie <attached: 00000012-AUDIO-2024-03-15-09-22-31.opus>, wo die Sprachnachricht hingehört. Nichts wandelt diese in lesbaren Text um, es sei denn, man baut etwas dafür.
Here's the part nobody tells you: Selbst wenn Menschen ein Transkriptionstool finden, stoßen sie oft auf ein strukturelles Problem. Tools, die generische Audiodateien verarbeiten – eine MP3 hochladen, Text zurückbekommen – wissen nicht, wo in einem Gespräch diese Audio hingehört. Sie transkribieren die Datei, verlieren aber den Kontext. Man erhält einen separaten Textblock ohne Sendernamen, ohne Zeitstempel, ohne Angabe, was davor oder danach gesagt wurde. Für eine rechtliche Angelegenheit, einen Geschäftsdatensatz oder ein Familienarchiv ist dieser Kontext der eigentliche Punkt.
Was ich gebaut habe, macht Folgendes: es liest die _chat.txt, um die Gesprächsstruktur zu verstehen, ordnet jede .opus-Referenz der richtigen Audiodatei im ZIP zu, transkribiert die Audio und fügt das Transkript an exakt der richtigen Position im Gespräch ein – mit dem Namen des Senders und dem ursprünglichen Zeitstempel. Das Ergebnis ist ein einziges PDF, in dem Textnachrichten und Sprachtranskripte natürlich abwechseln, genau wie das Gespräch stattgefunden hat.
Das ist das Problem, um das es in diesem Leitfaden geht.
Sprachnachrichten sind keine Dateien – sie sind ein In-App-Stream

WhatsApp Sprachnachrichten sehen in der App wie Audiodateien aus – eine Wellenformleiste, eine Dauer, eine Wiedergabeschaltfläche – aber sie werden nicht so gespeichert, wie die meisten erwarten. Wenn eine Sprachnachricht in WhatsApp durch Halten der Mikrofontaste aufgenommen wird, kodiert WhatsApp die Audio mit dem Opus-Codec und speichert sie als .opus-Datei in einem privaten Verzeichnis auf dem Gerät. Dieses Verzeichnis ist weder auf iPhone noch auf Android durch normales Dateibrowsing zugänglich. Man kann nicht zur App-Dateien navigieren und die Sprachnachrichten dort finden.
Die einzige Möglichkeit, diese .opus-Dateien zu extrahieren, ist über WhatsApps eigenes Menü "Chat exportieren" mit ausgewähltem "Mit Medien". Bei einem solchen Export verpackt WhatsApp das _chat.txt-Nachrichtenprotokoll zusammen mit dem Medienordner – und dort erscheinen die .opus-Dateien. Auf iOS landen sie im ZIP. Auf Android exportierten ältere WhatsApp-Versionen in einen Ordner im internen Speicher; neuere Versionen erstellen ein ZIP über den Teilen-Dialog, entsprechend dem iOS-Verhalten.
Opus ist für effiziente Sprachübertragung ausgelegt, aber ein Export hat keine universelle Abtastrate, Bitrate oder Dateigröße. WhatsApp kann je nach Nachrichtentyp, Gerät und Version unterschiedliche Dateien oder Container liefern. Für eine genaue Prüfung sollte die konkrete Datei mit VLC oder ffprobe untersucht werden; Hintergrundgeräusche, Mikrofonabstand und überlappende Stimmen beeinflussen die Transkription stärker als die Dateiendung allein.
Deshalb sind Routing und Kontrolle wichtig. ChatToPDF sendet jede unterstützte Datei an den passenden Anbieter, ohne eine feste Audiokonfiguration oder identische Genauigkeit für jede Aufnahme zu versprechen.
Ein weiterer struktureller Punkt: Jede WhatsApp-Sprachnachricht ist eine Einzelsprecher-Aufnahme. WhatsApps Push-to-Talk-Modell bedeutet, eine Person nimmt auf, dann hört sie auf, dann nimmt die andere Person auf. Das ist tatsächlich ein Transkriptionsvorteil – im Gegensatz zu einem aufgezeichneten Telefonanruf, bei dem zwei Stimmen auf demselben Audio-Track überlappen, gehört jede .opus-Datei in einem WhatsApp-Export genau einem Sender. ChatToPDF verwendet die Metadaten aus _chat.txt, um jedes Transkript der richtigen Person zuzuordnen, was dazu führt, dass ein Gespräch klar lesbar ist, selbst wenn beide Personen in Sprachnachrichten hin und her wechseln.
Wie der Router die Transkriptions-Engine auswählt

ChatToPDF hängt nicht mehr von einer einzigen Engine ab. Der aktuelle Pfad wählt pro Sprachnachricht zwischen Deepgram Nova-3 und ElevenLabs Scribe v2 – abhängig von unterstützter Sprache und Verfügbarkeit des Anbieters. Nova-3 deckt seine Sprachuntermenge ab; Scribe v2 erweitert das vollständige Register auf 93 Sprachen und kann auch als Alternativpfad dienen.
Whisper ist für ein kostenloses Modell beeindruckend, aber ich führte Genauigkeitstests an echten WhatsApp .opus-Dateien in Englisch, Spanisch, Hindi und Arabisch durch, und es zeigte konsistente Schwächen beim Code-Switching (eine Sprachnachricht, die mitten im Satz zwei Sprachen mischt) und bei nicht-US-englischen Akzenten. Es bietet auch keine kommerziellen SLAs oder Verfügbarkeitsgarantien, was wichtig ist, wenn zahlende Nutzer auf ihre Ausgabe warten.
AssemblyAI ist eine leistungsfähige Option und wurde in einem frühen Prototyp verwendet. Der aktuelle Produktionspfad kombiniert Deepgram Nova-3 und ElevenLabs Scribe v2, um die Sprachabdeckung zu erweitern und je nach unterstützter Sprache und Verfügbarkeit einen alternativen Pfad bereitzustellen.
Deepgram Nova-3 bleibt einer der Produktionspfade, ist aber nicht der einzige. Die $49 Premium+Voice- und $99 Power User-Konvertierungen verwenden denselben Nova-3/Scribe-v2-Router; sie unterscheiden sich bei Audio-Limit, Ausgabepaket und Warteschlangenpriorität, nicht durch ein Versprechen perfekter Genauigkeit.
Wo Nova-3 ältere Spracherkennungssysteme sichtbar übertrifft, ist in drei Bereichen: regionale Akzente (südafrikanisches Englisch, indisches Englisch, brasilianisches Portugiesisch), Fachvokabular (Namen, Adressen, Produktbegriffe, die ein generisches Modell falsch verstehen würde) und code-geswitchte Audio, bei der ein Sprecher innerhalb einer einzelnen Sprachnachricht zwischen Sprachen wechselt. Das sind die spezifischen Fehlermuster, die die Engine-Wahl motivierten. Die $29 Premium pro Chat-Konvertierung enthält überhaupt keine Transkription – sie erhält Sprachnachrichten als Platzhalterreferenzen im PDF, ohne die Audio durch ein Modell zu führen.
Die Pipeline funktioniert so: Das ZIP landet auf ChatToPDFs Server, unterstützte Audiodateien werden extrahiert und jede Sprachnachricht wird per authentifiziertem HTTPS an den vom Router gewählten Anbieter gesendet: Deepgram Nova-3 oder ElevenLabs Scribe v2. Die Transkripte werden dann an den richtigen Positionen in das Gespräch eingefügt, bevor das PDF gerendert wird.
Eine bewusste Wahl in der Pipeline: Unterstützte .opus-Audio wird vor der Transkription nicht vorverarbeitet oder neu kodiert. Nova-3 und Scribe v2 akzeptieren Opus nativ, sodass die Quelldatei ohne vorherige WAV- oder MP3-Konvertierung direkt an den ausgewählten Anbieter gehen kann.
Abdeckung und Genauigkeit für 93 unterstützte Sprachen

ChatToPDFs aktuelles Register umfasst 93 Sprachen; 57 liegen in veröffentlichten hohen oder ausgezeichneten Genauigkeitsbändern des Anbieters. Diese Bänder helfen bei der Planung der Prüfung, garantieren aber keine einzelne Aufnahme. Die folgenden Sprachen sind wichtige Beispiele, nicht die vollständige Liste:
Beispiele für die Abdeckung: Englisch, Spanisch, Portugiesisch, Französisch, Deutsch, Italienisch, Arabisch, Hindi, Indonesisch, Türkisch, Russisch, Niederländisch, Japanisch, Koreanisch, Chinesisch, Vietnamesisch und Thailändisch gehören zum aktuellen Register. Regionale Varianten, Eigennamen, Zahlen, starkes Code-Switching und verrauschte Aufnahmen müssen mit dem Originalton abgeglichen werden; wir veröffentlichen keine feste Fehlerrate für eine bestimmte Sprache oder Aufnahme.
Der Router kombiniert Deepgram Nova-3s unterstützte Untermenge mit der vollständigen Abdeckung von ElevenLabs Scribe v2. Das Verzeichnis der 93 Transkriptionssprachen zeigt die aktuelle Liste und die veröffentlichten Bänder. Abdeckung ersetzt nicht die Prüfung von Namen, Zahlen, Dialekten, Rauschen oder zitierten Passagen.
Das Routing erfolgt pro Sprachnachricht. Ein Chat kann Notizen in mehreren unterstützten Sprachen enthalten, doch starkes Code-Switching innerhalb einer einzelnen Aufnahme bleibt schwieriger. Insbesondere 50/50-Passagen, Eigennamen und Beträge sollten mit dem Originalaudio verglichen werden.
Beispiel-Transkript: Spanische Sprachnachricht → Text (echtes Beispiel)

Das ist eine echte WhatsApp Sprachnachricht, transkribiert auf dem $49 Premium+Voice pro Chat-Konvertierungsniveau. Der Sender war ein Muttersprachler des kolumbianischen Spanisch, aufgenommen auf einem Android-Gerät in einer ruhigen Innenumgebung. Dauer: 18 Sekunden. Dateigröße: ~28 KB im .opus-Format.
Originalaudio (paraphrasiert): Eine informelle Sprachnachricht zur Bestätigung eines Termins am nächsten Tag, mit Sorge um die Gesundheit der anderen Person und der Bitte um eine Textnachricht bei Planänderungen.
Transkriptausgabe im PDF:
🎤 [Sprachnachricht – 0:18] "Hola, ¿cómo estás? Te llamo para confirmar la cita de mañana a las tres de la tarde. Si no puedes, mándame un mensaje. ¿Vale?"
Der Sender wird im PDF mit dem Namen aus _chat.txt zugeordnet, der Zeitstempel ist der von WhatsApp aufgezeichnete Sendezeitpunkt der Sprachnachricht, und das Transkript sitzt inline zwischen den Textnachrichten unmittelbar davor und danach im Gespräch.
Einige Dinge sind an diesem Beispiel bemerkenswert. Der formale Registermarker ¿Vale? – näher an "Okay?" oder "Einverstanden?" in der Bedeutung – wurde korrekt transkribiert statt mit bale verwechselt oder weggelassen. Der Zeitausdruck a las tres de la tarde ("um drei Uhr nachmittags") wurde korrekt wiedergegeben, was für eine Terminbestätigung wichtig ist, bei der ein Fehler irreführend wäre.
Wo bricht die Spanisch-Genauigkeit ein? Die häufigsten Fehler, die ich sehe, sind Homophones. In schneller Umgangssprache sind diese phonetisch identisch. Nova-3 verwendet den umgebenden Kontext, um die korrekte Schreibweise die meiste Zeit abzuleiten, ist aber nicht perfekt. Bei einem Dokument, das als rechtliches Protokoll verwendet werden soll, würde ich eine leichte menschliche Überprüfung jeder Sprachnachricht empfehlen, die wörtlich zitiert werden soll.
Wenn keine Transkription benötigt wird – zum Beispiel, nur die Textnachrichten als PDF konvertiert werden sollen und Platzhalterreferenzen für Sprachnachrichten akzeptabel sind – verarbeitet die $29 Premium pro Chat-Konvertierung diesen Fall zu einem niedrigeren Preis. Die $49 Premium+Voice pro Chat-Konvertierung ist der richtige nächste Schritt, wenn das tatsächlich Gesprochene als lesbarer Text im Dokument erscheinen soll.
Beispiel-Transkript: Hindi (gemischtes Hinglish) → Text (echtes Beispiel)

Starkes Code-Switching innerhalb einer einzelnen Notiz bleibt für jeden Pfad schwierig. Nova-3 und Scribe v2 haben unterschiedliche Abdeckung; Namen, Zahlen und zitierte Passagen sollten mit dem Originalton geprüft werden, statt einen festen prozentualen Vorteil anzunehmen.
Hier ist ein echtes Transkript aus der $49 Premium+Voice pro Chat-Konvertierung:
🎤 [Sprachnachricht – 0:22] "Yaar, kal meeting hai 3 baje, please attend karna. Project deadline aa rahi hai aur boss bahut strict hai."
Übersetzung: "Kumpel, morgen ist ein Meeting um 3, bitte teilnehmen. Die Projektdeadline rückt näher und der Chef ist sehr streng."
Das Hinglish-Beispiel ist ein Prüfbeispiel, kein universeller Benchmark: Eingebettete englische Wörter können je nach Aufnahme und gewähltem Pfad erhalten bleiben oder verändert werden. Originalton aufbewahren und wichtige Begriffe prüfen.
Der Unterschied ist wichtig, wenn das Transkript als Arbeitsdatensatz verwendet wird. Wenn der Manager einer Person ein Sprachtranskript als Dokumentation einer Projektzusage prüft und das Wort deadline nicht im Text erscheint, ist das keine geringfügige Genauigkeitsfrage – es fehlt ein wichtiger Informationsteil.
Die Senderzuweisung stammt aus _chat.txt: WhatsApp-Name und Zeitstempel erscheinen neben dem vom gewählten Anbieter zurückgegebenen Transkript.
Ein Hinweis zu Hindi speziell: Wenn die Sprachnachricht in Devanagari-dominantem Hindi ist (formales, schriftsprachliches Hindi mit minimalem Englisch), ist die Genauigkeit über die unterstützten Stufen hinweg konsistent stark. Die $49 Premium+Voice pro Chat-Konvertierung ist der richtige Einstiegspunkt für Hindi-Sprachnachrichten, die transkribiert werden sollen; die $99 Power User pro Chat-Konvertierung deckt dieselbe Genauigkeit ohne Audio-Obergrenze und mit Warteschlangenpriorität ab. Die $29 Premium pro Chat-Konvertierung erhält Sprachnachrichten nur als Platzhalter – keine Transkription läuft bei dieser Stufe.
Die $49 Premium+Voice Stufe – was enthalten ist und was nicht

Die $49 Premium+Voice pro Chat-Konvertierung ist die Stufe, die ich speziell für sprachnotenreiche Chats gebaut habe. Hier ist genau, was sie enthält und was nicht.
Was in der $49 Premium+Voice pro Chat-Konvertierung enthalten ist:
- Sprachbewusstes Routing – jede unterstützte Sprachnachricht kann über Deepgram Nova-3 oder ElevenLabs Scribe v2 verarbeitet werden
- Ein Register mit 93 Sprachen – 57 liegen in veröffentlichten hohen oder ausgezeichneten Genauigkeitsbändern; Abdeckung garantiert keine einzelne Aufnahme
- Bis zu 8 Stunden Audio in einem einzigen Chat – deckt die große Mehrheit sprachnotenreicher Gespräche ab; wenn der Chat 8 Stunden Gesamtaufnahmeaudio überschreitet, hebt die $99 Power User pro Chat-Konvertierung diese Grenze auf
- Kein Nachrichtenlimit – keine Obergrenze für die Anzahl der Nachrichten im Chat, der konvertiert wird
- Senderzuweisung bei Transkripten – jedes Transkript im PDF trägt den WhatsApp-Sendernamen aus den Exportmetadaten
- Zeitstempel erhalten – der ursprüngliche WhatsApp-Zeitstempel erscheint neben jedem Transkript, nicht die Transkriptionszeit
- Drei Ausgabeformate – PDF, XLSX und CSV alle enthalten; das XLSX ist nützlich zum Filtern oder Sortieren nach Sender und Zeitstempel
- Sieben-Tage-Quelldateiaufbewahrung – verschlüsselt im Ruhezustand (AES-256), in Übertragung (TLS 1.3)
Was in der $49 Premium+Voice pro Chat-Konvertierung nicht enthalten ist:
- Fachvokabular – der aktuelle Ablauf nimmt beim Upload kein benutzerdefiniertes Glossar an; Eigennamen, Akronyme und seltene Begriffe sollten mit dem Originalton geprüft werden
Die Stufe darüber – $99 Power User pro Chat-Konvertierung – enthält alles in $49 Premium+Voice pro Chat-Konvertierung plus Prioritätswarteschlangen-Verarbeitung und Massen-Chat-Verarbeitung. Wenn ein einzelner Chat konvertiert wird und Geschwindigkeit nicht kritisch ist (die meisten Konvertierungen sind in unter drei Minuten fertig), ist die $49 Premium+Voice pro Chat-Konvertierung das richtige Niveau.


Zur Orientierung der vollständige Stufenüberblick: $7 Basic pro Chat (nur Text, 5.000-Nachrichten-Limit), $14 Standard pro Chat (Bilder, 25.000-Nachrichten-Limit), $29 Premium pro Chat (kein Produktlimit für Nachrichten, XLSX/CSV, Sprachnachrichten als Platzhalter), $49 Premium+Voice pro Chat (93-Sprachen-Router, 8-Stunden-Audio-Limit) und $99 Power User pro Chat (derselbe Router, keine Audio-Dauergrenze und Prioritätswarteschlange).
Warum keine Echtzeit-Transkription (und das auch nicht kommen wird)

Das kommt oft genug auf, dass es eine direkte Antwort verdient. Menschen fragen, warum ChatToPDF keine Sprachnachrichten beim Eintreffen abhört – jede einzeln transkribiert, sobald sie gesendet wird – statt einen ZIP-Export nachträglich zu erfordern.
Die kurze Version: WhatsApp gibt Entwicklern keinen Zugang zu eingehenden Nachrichten oder Audio in Echtzeit. Es gibt keinen offiziellen WhatsApp Business API-Endpunkt, der Sprachnachrichten beim Eintreffen offenlegt. Der einzige unterstützte Drittanbieter-Zugangspfad führt über den Export-Chat-Mechanismus, der eine Momentaufnahme des Gesprächsverlaufs zu einem bestimmten Zeitpunkt ist. Echtzeit-Transkription auf WhatsApp aufzubauen würde erfordern, den lokalen Speicher der App auf dem Gerät abzufangen, was sowohl technisch fragil als auch außerhalb der Plattformrichtlinien von WhatsApp ist.
Aber es gibt einen praktischeren Grund, warum ich nicht versucht habe, diese Einschränkung zu umgehen. Der Anwendungsfall für die Transkription von WhatsApp Audio ist fast ausnahmslos retrospektiv. Jemand empfängt dreißig Sprachnachrichten im Verlauf eines Streits und möchte ein lesbares Protokoll. Ein Geschäftsteam nutzt Sprachnachrichten für Projektaktualisierungen und braucht sie durchsuchbar. Eine Familie sendet jahrelang Sprachnachrichten und möchte sie vor einem Handyupgrade archivieren. Keine dieser Situationen beinhaltet eine "jetzt sofort beim Eintreffen"-Anforderung. Es sind alles "ich habe einen Satz von Aufnahmen, die ich konvertieren muss"-Situationen.
Die asynchrone Verarbeitung nutzt die vollständige Audiodatei statt eines Live-Streams. Das unterstützt den dokumentorientierten Ablauf, ist aber keine Garantie für eine bestimmte Fehlerquote; die Aufnahmequalität und der gewählte Anbieter bleiben entscheidend.
Es gibt auch die Akku- und Netzwerkfrage. Eine offene WebSocket-Verbindung zu betreiben, die Audio-Fragmente in Echtzeit an eine Inferenz-API streamt, würde den Telefonakku bei einem langen Gespräch merklich entleeren. Es würde eine aktive Internetverbindung für jede empfangene Sprachnachricht erfordern, nicht nur wenn man konvertieren möchte. Und es würde einen kontinuierlichen Datenfluss der Gespräche zu einem Drittanbieter-Server schaffen – was ich Nutzern nicht zumuten möchte.
Das Export-und-Upload-Modell ist in der Uhrzeit langsamer – man muss warten, bis man bereit ist zu konvertieren, dann den Export durchführen, dann hochladen. Aber für die tatsächlichen Anwendungsfälle, die Menschen haben, ist das in Ordnung. Niemand versucht, eine Sprachnachricht zu transkribieren, die er vor drei Sekunden erhalten hat, für ein Echtzeit-Dokument. Sie konvertieren einen Chat, den sie behalten wollen.
Datenschutz: wo das Audio landet und wo nicht

Das ist der Teil, bei dem ich spezifisch sein möchte, weil die Natur der Sprachnachrichten – Audioaufnahmen echter Gespräche – bedeutet, dass die Datenschutzrisiken höher sind als bei reinen Textnachrichten.
Hier ist der genaue Datenpfad für eine Sprachnachricht, die über die $49 Premium+Voice pro Chat-Konvertierung übermittelt wird:
Schritt 1 – Upload. Die ZIP-Datei wird vom Browser über HTTPS (TLS 1.3) an ChatToPDFs Server übertragen. Die Verbindung ist während der Übertragung verschlüsselt. Das ZIP landet in einem temporären Verarbeitungsverzeichnis, nicht in dauerhaftem Speicher, während die Extraktion läuft.
Schritt 2 – Extraktion. Die .opus-Dateien werden aus dem ZIP extrahiert. Jede Datei wird ihrer _chat.txt-Referenz nach Dateinamenmuster zugeordnet. An diesem Punkt existieren die Audiodateien nur auf ChatToPDFs Verarbeitungsserver.
Schritt 3 – Aufruf des Transkriptionsanbieters. Jede unterstützte Datei wird per authentifiziertem HTTPS an den für diese Sprachnachricht gewählten Anbieter gesendet: Deepgram Nova-3 oder ElevenLabs Scribe v2. Deepgram-Anfragen enthalten die Abwahl des Modellverbesserungsprogramms. Der Anbieter erhält das für die Transkription nötige Audio, nicht den vollständigen Chattext.
Schritt 4 – Speicherung. Das Transkript wird in das PDF eingebunden und verschlüsselt im Ruhezustand (AES-256) in AWS S3 gespeichert. Das Quell-ZIP, einschließlich der .opus-Dateien, wird ebenfalls sieben Tage verschlüsselt gespeichert.
Schritt 5 – Zustellung. Der PDF-Download-Link erscheint auf dem Bildschirm und in der E-Mail. Der Link ist an die Job-ID gebunden. Er ist nicht erratbar und wird nirgendwo indiziert.
Schritt 6 – Automatische Löschung. Sieben Tage nach der Job-Erstellung werden das Quell-ZIP und das Ausgabe-PDF automatisch aus dem Speicher gelöscht. Das ist ein geplanter Löschjob, kein manueller Prozess. Es gibt keine Ausnahmen und keine Verlängerungen.
Wo das Audio nicht hingeht: Es geht nicht an eine Analytics-Plattform. Es wird nicht für das Training von ChatToPDF-Modellen verwendet (ChatToPDF trainiert keine Modelle). Der Textinhalt der Sprachnachrichten ist für ChatToPDF-Mitarbeiter nicht sichtbar – die Verarbeitung ist vollständig automatisiert. Kein Drittanbieter erhält den Text der Chat-Nachrichten.
Der externe Schritt gehört in jede Datenschutzprüfung. ChatToPDF kontrolliert die eigene Pipeline, Deepgram und ElevenLabs kontrollieren jedoch ihre Verarbeitung nach ihren jeweiligen Bedingungen. Bei privilegierten, regulierten oder hochsensiblen Inhalten sollte das verantwortliche Team vor dem Upload die aktuellen Bedingungen beider Anbieter prüfen.
Sonderfälle: Hintergrundlärm, mehrere Sprecher, Stimmveränderungseffekte

Echte WhatsApp Sprachnachrichten werden nicht in schallisolierten Studios aufgenommen. Sie werden in Autos, Küchen, Straßengesprächen und belebten Cafés aufgenommen. Hier ist, wie jedes dieser Szenarien die Transkriptionsgenauigkeit beeinflusst, und was ChatToPDF tut, wenn die Genauigkeit auf ein inakzeptables Niveau sinkt.
Hintergrundlärm nach Umgebung.
Eine Sprachnachricht aus einer ruhigen Innenumgebung ist meist leichter zu transkribieren als eine Aufnahme mit Rauschen, Clipping, mehreren Stimmen oder Sprachwechseln. Das veröffentlichte Band einer Sprache sagt das Ergebnis einer einzelnen Aufnahme nicht voraus.
Mehrere Sprecher innerhalb einer einzelnen Sprachnachricht.
Wenn eine weitere Person hörbar im Hintergrund spricht, kann der gewählte Anbieter diese Stimme ebenfalls transkribieren. Das Ergebnis kann beide Stimmen dem WhatsApp-Sender zuordnen; solche Stellen sollten mit dem Audio geprüft werden.
ChatToPDF kann derzeit nicht den Primärsprecher isolieren und Hintergrundstimmen innerhalb eines einzelnen .opus-Clips verwerfen. Sprecher-Diarisierung – die Identifikation, welche Audio-Segmente von welcher Person in derselben Audiodatei stammten – ist eine Funktion, die für eine zukünftige Stufe evaluiert wird, aber zusätzliche Infrastruktur erfordert und nicht in der aktuellen Version enthalten ist.
Stimmveränderungseffekte.
Für Clips, bei denen die Konfidenz unter den in der Pipeline festgelegten Schwellenwert fällt – derzeit definiert als durchschnittlicher Wort-Konfidenzwert unter 0,6 über den Clip – markiert ChatToPDF das Transkript im PDF als [Transkription mit niedriger Konfidenz – Audioqualität unzureichend] statt einen Textblock auszugeben, der als autoritativ angesehen werden könnte. Dieses Zeichen neben der Position der Sprachnachricht im Gespräch ist besser als ein unsicheres Ergebnis zurückzugeben, das 40% falsch sein könnte.
FAQ
Welches Dateiformat verwenden WhatsApp Sprachnachrichten, und verarbeitet ChatToPDF es?
WhatsApp speichert Sprachnachrichten üblicherweise als Opus-Audio in .opus-Dateien. ChatToPDF extrahiert unterstütztes Audio aus dem Export-ZIP und sendet jede Aufnahme in ihrem nativen Format gemäß Router an Deepgram Nova-3 oder ElevenLabs Scribe v2; eine vorherige Rekodierung ist nicht erforderlich.
Wie genau ist die WhatsApp Audio-Transkription?
Die Genauigkeit hängt vor allem von der Aufnahme ab. $49 Premium+Voice und $99 Power User verwenden denselben Nova-3/Scribe-v2-Router; Power User ändert Audio-Limit und Priorität, garantiert aber keine höhere Genauigkeit. $29 Premium transkribiert nicht. Rauschen, überlappende Stimmen, Clipping, Akzente, Dialekte und Sprachwechsel können die Qualität mindern; Namen, Daten, Beträge und Zitate sollten mit dem Originalaudio geprüft werden.
Transkribiert ChatToPDF Sprachnachrichten in anderen Sprachen als Englisch?
Ja. $49 Premium+Voice und $99 Power User verwenden einen sprachbewussten Router zwischen Deepgram Nova-3 und ElevenLabs Scribe v2 für das aktuelle Register mit 93 Sprachen; 57 liegen in veröffentlichten hohen oder ausgezeichneten Genauigkeitsbändern. Scribe v2 deckt das gesamte Register und Nova-3 seine unterstützte Untermenge ab. Abdeckung garantiert nicht jeden Dialekt oder jede Aufnahme. $29 Premium transkribiert keine Sprachnachrichten.
Muss ich beim WhatsApp-Export etwas anders machen, wenn ich Sprachtranskripte möchte?
Ja – ein kritischer Schritt. Beim Exportieren des Chats aus WhatsApp "Mit Medien" statt "Ohne Medien" wählen. Sprachnachrichten (.opus-Dateien) sind nur im Export enthalten, wenn "Mit Medien" ausgewählt wird. Bei "Ohne Medien"-Export enthält _chat.txt zwar Referenzen wie <attached: 00000012-AUDIO-2024-03-15-09-22-31.opus>, aber keine tatsächlichen Audiodateien. ChatToPDF kann keine Sprachnachricht transkribieren, die es nicht hat. Den WhatsApp chat export Leitfaden für den vollständigen Schritt-für-Schritt-Exportprozess lesen.
Erscheinen die Sprachtranskripte an der richtigen Stelle im PDF?
Ja. ChatToPDF liest das Nachrichtenprotokoll in _chat.txt, um die Gesprächsstruktur zu verstehen, ordnet jede .opus-Referenz der entsprechenden Audiodatei per Dateiname zu und fügt das Transkript genau an der Position im Gespräch ein, wo die Sprachnachricht gesendet wurde. Der Sendername aus den WhatsApp-Metadaten und der ursprüngliche Zeitstempel erscheinen beide neben dem Transkript. Die Ausgabe ist ein einziges Dokument, in dem Textnachrichten und Sprachtranskripte in der richtigen chronologischen Reihenfolge abwechseln.
Was passiert mit meinen Audiodateien nach Abschluss der Transkription?
Audiodateien werden im ChatToPDF-Job verschlüsselt gespeichert und nur an den für die jeweilige Aufnahme gewählten Anbieter gesendet: Deepgram oder ElevenLabs. Deepgram-Anfragen wählen das Modellverbesserungsprogramm ab. Die Löschung von Quelldateien, extrahiertem Audio und Downloads ist nach sieben Tagen vorgesehen; ein noch verarbeitender Job kann eine begrenzte Verlängerung von bis zu 24 Stunden erhalten. Mehr dazu im WhatsApp-to-PDF-Datenschutzabschnitt.
Kann ChatToPDF zwei verschiedene Sprecher in derselben Sprachnachricht unterscheiden?
Derzeit nicht. Jede WhatsApp Sprachnachricht wird der Person zugeordnet, die sie gesendet hat, anhand der Senderinformation aus _chat.txt. Innerhalb einer einzelnen Sprachnachricht, wenn sowohl der Sender als auch eine andere Person sprechen (zum Beispiel führt der Sender ein Telefongespräch beim Aufnehmen), werden beide Stimmen transkribiert, aber dem WhatsApp-Sender zugeordnet. ChatToPDF führt derzeit keine Sprecher-Diarisierung innerhalb einzelner Audioclips durch. Bei Sprachnachrichten, wo Hintergrundstimmen hörbar und verständlich sind, können verschachtelte Sprache im Transkript erscheinen.

Für den vollständigen Chat-zu-PDF-Workflow – einschließlich des Exports auf iPhone und Android, was das ZIP enthält und wie alle fünf Stufen für Nicht-Sprach-Konvertierungen vergleichen – den WhatsApp to PDF Leitfaden lesen. Wenn auf Android ist und der Export vor dem Hochladen auf ein anderes Gerät übertragen werden muss, deckt der WhatsApp Android-zu-iPhone-Transferleitfaden diesen Prozess ab.
I'm Paul, the founder of ChatToPDF. I built it after needing a long WhatsApp conversation as a readable PDF for a legal matter. I test and document WhatsApp exports, PDF conversion, voice-note transcription, and the limits people should check before relying on the result.

