ما يعنيه "transcribe WhatsApp audio" فعلًا (ولماذا هو أصعب مما يبدو)
يستخدم الناس عبارة "transcribe WhatsApp audio" للإشارة إلى ثلاثة أشياء مختلفة على الأقل. بعضهم يريد تفريغ المكالمات الصوتية المباشرة — التي لا تتيحها WhatsApp عبر أي API للمطورين وهي تقنيًا فئة منتج مستقلة عما أصفه هنا. وبعضهم يريد تحويل ملفات صوتية حفظها من WhatsApp إلى نص معاملًا ملف .opus كمدخل مستقل. وبعضهم — وهم الأغلبية — يريد تحويل كل رسالة صوتية داخل محادثة WhatsApp مُصدَّرة إلى نص مقروء ليُشكّل المحادثة كاملةً وثيقةً مفهومة.
ChatToPDF مبني لحالة الاستخدام الثالثة (وهي التي أحلّها أنا — I built it for this exact gap). المشكلة التي يحلّها محددة: تُصدّر محادثة WhatsApp تحتوي رسائل نصية ورسائل صوتية، وما تحصل عليه من WhatsApp ZIP يحتوي _chat.txt ومجلد ملفات الوسائط. يتضمن _chat.txt أسطرًا مثل <attached: 00000012-AUDIO-2024-03-15-09-22-31.opus> في موضع الرسالة الصوتية. لا شيء يحوّل هذه إلى نص مقروء ما لم تبنِ شيئًا لذلك.
هذا ما لا يخبرك به أحد (here's the part nobody tells you): حتى حين يجد الناس أداة تفريغ يصطدمون بمشكلة هيكلية. الأدوات التي تتعامل مع ملفات صوتية عامة — ارفع MP3 واحصل على نص — لا تعرف موضع ذلك الصوت في المحادثة. تُفرّغ الملف لكنها تفقد السياق. تنتهي بكتلة نص منفصلة بلا اسم مُرسِل ولا طابع زمني ولا إشارة إلى ما قيل قبلها أو بعدها. في قضية قانونية أو سجل أعمال أو أرشيف عائلي، هذا السياق هو جوهر الأمر.
ما بنيتُه يفعل التالي: يقرأ _chat.txt ليفهم بنية المحادثة، يُطابق كل مرجع .opus مع الملف الصوتي الصحيح في ZIP، يُفرّغ الصوت، ويُدرج التفريغ في موضعه الدقيق في المحادثة — مع حفظ اسم المُرسِل والطابع الزمني الأصلي. النتيجة وثيقة PDF واحدة تتناوب فيها الرسائل النصية وتفريغات الرسائل الصوتية بشكل طبيعي، تمامًا كما جرت المحادثة.
تلك هي المشكلة التي يتناولها هذا الدليل.
الرسائل الصوتية ليست ملفات — إنها بث داخل التطبيق

الرسائل الصوتية في WhatsApp تبدو كملفات صوتية داخل التطبيق — شريط موجي ومدة وزر تشغيل — لكنها لا تُخزَّن كما يتوقع معظم الناس. حين تسجّل رسالة صوتية في WhatsApp بالضغط على زر الميكروفون، يُشفّر WhatsApp الصوت باستخدام ترميز Opus ويحفظه كملف .opus في دليل خاص على جهازك. لا يمكن الوصول إلى هذا الدليل عبر التصفح العادي للملفات على iPhone أو Android. لا يمكنك التنقل إليه في تطبيق الملفات وتجد رسائلك الصوتية هناك.
الطريقة الوحيدة لاستخراج ملفات .opus هذه هي من خلال قائمة "تصدير الدردشة" في WhatsApp مع اختيار "تضمين الوسائط". عند التصدير بهذه الطريقة يُجمّع WhatsApp سجل رسائل _chat.txt جنبًا إلى جنب مع مجلد الوسائط — وهنا تظهر ملفات .opus. على iOS تنتهي داخل ZIP. على Android، كانت الإصدارات القديمة تُصدّر إلى مجلد في التخزين الداخلي؛ الإصدارات الأحدث تُنشئ ZIP عبر واجهة المشاركة مطابقةً سلوك iOS.
صُمّم Opus لنقل الكلام بكفاءة، لكن ملف التصدير لا يملك معدل عيّنة أو معدل بت أو حجمًا ثابتًا عالميًا. قد ينتج WhatsApp ملفات أو حاويات مختلفة بحسب نوع الرسالة والجهاز وإصدار التطبيق. للتحقق الدقيق افحص الملف الفعلي عبر VLC أو ffprobe؛ فالضجيج والمسافة عن الميكروفون وتداخل الأصوات تؤثر في التفريغ أكثر من امتداد الملف وحده.
لهذا يهم التوجيه والمراجعة. يرسل ChatToPDF كل ملف مدعوم إلى المزوّد الأنسب دون وعد بإعداد صوتي ثابت أو دقة متطابقة لكل التسجيلات.
نقطة هيكلية أخرى: كل رسالة صوتية في WhatsApp تسجيل لمُرسِل واحد. نموذج الضغط على الزر للتحدث في WhatsApp يعني أن شخصًا واحدًا يسجّل ثم يتوقف ثم يسجّل الآخر ردّه. هذه ميزة للتفريغ — خلافًا لمكالمة هاتفية مسجّلة حيث يتداخل صوتان في نفس المسار الصوتي، كل ملف .opus في تصدير WhatsApp ينتمي لمُرسِل واحد بالضبط. يستخدم ChatToPDF البيانات الوصفية من _chat.txt لنسب كل تفريغ للشخص الصحيح، وهذا كيف تحصل على محادثة مقروءة بوضوح حتى حين يتناوب الطرفان في الرسائل الصوتية.
كيف يختار الموجّه محرك التفريغ

لا يعتمد ChatToPDF الآن على محرك واحد. يختار المسار الحالي لكل رسالة بين Deepgram Nova-3 وElevenLabs Scribe v2 وفق اللغة المدعومة وتوافر المزوّد. يغطي Nova-3 مجموعته الفرعية من اللغات، بينما يوسّع Scribe v2 السجل الكامل إلى 93 لغة ويمكن أن يعمل مسارًا بديلًا.
Whisper مثير للإعجاب كنموذج مجاني، لكنني أجريت اختبارات دقة على مجموعة من ملفات WhatsApp .opus الحقيقية عبر الإنجليزية والإسبانية والهندية والعربية، وأبدى نقاط ضعف متسقة في التبديل بين الكودات (رسالة صوتية تمزج لغتين في منتصف الجملة) وفي لهجات الإنجليزية غير الأمريكية. كما أنه لا يقدم اتفاقيات مستوى خدمة تجارية أو ضمانات وقت تشغيل، وهو أمر مهم حين يتظر مستخدمون دافعون لمخرجاتهم.
يظل AssemblyAI خيارًا جيدًا وقد استُخدم في نموذج أولي مبكر. يجمع مسار الإنتاج الحالي بين Deepgram Nova-3 وElevenLabs Scribe v2 لتوسيع تغطية اللغات وتوفير مسار بديل وفق اللغة المدعومة وتوافر المزوّد.
يبقى Deepgram Nova-3 أحد مسارات الإنتاج، لكنه ليس الوحيد. يستخدم تحويل Premium+Voice بـ 49 دولارًا وPower User بـ 99 دولارًا موجّه Nova-3/Scribe v2 نفسه؛ الفرق في حد الصوت وحزمة المخرجات وأولوية القائمة، لا في وعد بدقة مثالية.
حيث يتفوق Nova-3 بشكل واضح على محركات تحويل الكلام إلى نص الأقدم هو في ثلاثة مجالات: اللهجات الإقليمية (إنجليزية جنوب أفريقيا وإنجليزية الهند والبرتغالية البرازيلية)، والمفردات التقنية (الأسماء والعناوين ومصطلحات المنتجات التي نموذج عام قد يُخطئ سماعها)، والصوت المُبدَّل بين الكودات حيث يتنقل المُتحدث بين لغتين داخل رسالة صوتية واحدة. تلك هي أنماط الفشل المحددة التي دفعت إلى اختيار المحرك. تحويل Premium بـ 29 دولارًا لكل دردشة لا يشمل التفريغ أصلًا — يحفظ الرسائل الصوتية كمراجع عنصر نائب في PDF دون تشغيل الصوت في أي نموذج.
يعمل المسار هكذا: يصل ZIP إلى خادم ChatToPDF، وتُستخرج ملفات الصوت المدعومة، ثم تُرسل كل رسالة عبر HTTPS موثّق إلى المزوّد الذي يختاره الموجّه: Deepgram Nova-3 أو ElevenLabs Scribe v2. تُعاد التفريغات إلى مواضعها الصحيحة في المحادثة قبل تصيير PDF.
خيار متعمد في المسار: لا يُعاد ترميز صوت .opus المدعوم قبل التفريغ. يقبل Nova-3 وScribe v2 صيغة Opus مباشرةً، لذا يمكن إرسال الملف الأصلي إلى المزوّد المختار دون تحويل مسبق إلى WAV أو MP3.
التغطية والدقة عبر 93 لغة مدعومة

يغطي سجل ChatToPDF الحالي 93 لغة؛ تقع 57 منها ضمن فئات دقة عالية أو ممتازة ينشرها المزوّد. تساعد هذه الفئات في التخطيط للمراجعة لكنها لا تضمن نتيجة تسجيل بعينه. اللغات أدناه أمثلة مهمة وليست القائمة الكاملة:
أمثلة على التغطية: الإنجليزية والإسبانية والبرتغالية والفرنسية والألمانية والإيطالية والعربية والهندية والإندونيسية والتركية والروسية والهولندية واليابانية والكورية والصينية والفيتنامية والتايلاندية ضمن السجل الحالي. يجب مراجعة اللهجات والأسماء والأرقام والتبديل المكثف بين اللغات والتسجيلات الصاخبة بمقارنتها بالصوت الأصلي؛ لا ننشر معدل خطأ ثابتًا للغة أو لتسجيل بعينه.
يجمع الموجّه بين مجموعة Deepgram Nova-3 المدعومة والتغطية الكاملة لـ ElevenLabs Scribe v2. راجع دليل لغات التفريغ الـ 93 للقائمة الحالية والفئات المنشورة. لا تغني التغطية عن مراجعة الأسماء والأرقام واللهجات والضوضاء والمقاطع المقتبسة.
يحدث التوجيه لكل رسالة على حدة. يمكن أن تضم الدردشة رسائل بلغات مدعومة مختلفة، لكن التبديل المكثف داخل رسالة واحدة يظل أصعب. تحقّق خصوصًا من المقاطع 50/50 والأسماء والمبالغ بمقارنتها بالصوت الأصلي.
نموذج تفريغ: رسالة صوتية إسبانية ← نص (مثال حقيقي)

هذه رسالة صوتية حقيقية من WhatsApp مُفرَّغة في مستوى تحويل Premium+Voice بـ 49 دولارًا لكل دردشة. المُرسِل ناطق أصلي بالإسبانية الكولومبية، مسجّلة على جهاز Android في بيئة داخلية هادئة. المدة: 18 ثانية. حجم الملف: ~28 كيلوبايت بصيغة .opus.
الصوت الأصلي (مُختصَر): رسالة صوتية غير رسمية تُؤكّد موعدًا في اليوم التالي وتُعرب عن القلق على صحة الطرف الآخر وتطلب ردًا نصيًا إذا تغيّرت الخطط.
مخرج التفريغ في PDF:
🎤 [رسالة صوتية — 0:18] "Hola, ¿cómo estás? Te llamo para confirmar la cita de mañana a las tres de la tarde. Si no puedes, mándame un mensaje. ¿Vale?"
يُنسب المُرسِل في PDF باسمه من _chat.txt، الطابع الزمني هو الذي سجّلته WhatsApp حين أُرسلت الرسالة الصوتية، والتفريغ يقع مضمّنًا بين الرسائل النصية قبله وبعده مباشرةً في المحادثة.
بعض ما يلفت الانتباه في هذا المثال. علامة الأسلوب الرسمي ¿Vale? — الأقرب في المعنى إلى "حسنًا؟" — فُرّغت بشكل صحيح دون الخلط بـ bale أو حذفها. عبارة الوقت a las tres de la tarde ("في الثالثة بعد الظهر") صيغت بدقة، وهو ما يهم في تأكيد موعد حيث الخطأ يكون مُضلِّلًا. التصاعد المنطوق في نبرة ¿cómo estás? لم يكن غامضًا بما يكفي لإنتاج خطأ في التفريغ.
أين تتراجع دقة الإسبانية؟ الأخطاء الأكثر شيوعًا التي أراها هي المترادفات: haya (منصوب haber) مقابل halla (من hallar، يجد)، tubo (أنبوب) مقابل tuvo (ماضي tener). في الكلام غير الرسمي السريع هذه متطابقة صوتيًا. يستخدم Nova-3 السياق المحيط للاستنتاج بالتهجئة الصحيحة في معظم الأحيان، لكنه غير مثالي. في وثيقة ستُستخدم كسجل قانوني، أوصي بمراجعة بشرية خفيفة لأي رسائل صوتية سيُستشهد بتفريغها حرفيًا.
إذا لم تكن تحتاج التفريغ أصلًا — مثلًا تريد فقط تحويل الرسائل النصية إلى PDF وأنت مرتاح بمراجع العنصر النائب للرسائل الصوتية — يتعامل تحويل Premium بـ 29 دولارًا لكل دردشة مع تلك الحالة بسعر أقل. تحويل Premium+Voice بـ 49 دولارًا لكل دردشة هو الخطوة الصحيحة حين تحتاج ظهور الإسبانية المنطوقة فعلًا كنص مقروء في الوثيقة.
نموذج تفريغ: هندية (هنجلش مختلطة) ← نص (مثال حقيقي)

يبقى التبديل المكثف بين اللغات داخل رسالة واحدة صعبًا لأي مسار. تختلف تغطية Nova-3 وScribe v2، لذلك يجب التحقق من الأسماء والأرقام والمقاطع المقتبسة بمقارنتها بالصوت الأصلي بدل افتراض تفوق بنسبة ثابتة.
إليك تفريغًا حقيقيًا من تحويل Premium+Voice بـ 49 دولارًا لكل دردشة:
🎤 [رسالة صوتية — 0:22] "Yaar, kal meeting hai 3 baje, please attend karna. Project deadline aa rahi hai aur boss bahut strict hai."
الترجمة: "يا صاح، غدًا اجتماع الساعة 3، رجاءً احضر. الموعد النهائي للمشروع يقترب والمدير صارم جدًا."
يوضح مثال الهنجلش حالة تحتاج مراجعة، لا اختبارًا معياريًا عامًا: قد تُحفظ الكلمات الإنجليزية داخل جملة هندية أو تتغير بحسب التسجيل والمسار المختار. احتفظ بالصوت وتحقق من المصطلحات المهمة.
الفرق مهم حين تستخدم التفريغ كسجل في مكان العمل. إذا كان مدير شخص ما يراجع تفريغ رسالة صوتية كتوثيق لالتزام بمشروع وكلمة deadline لا تظهر في النص، فهذه ليست اعتراض دقة بسيط — إنها معلومة مفقودة.
يأتي نسب المُرسِل من _chat.txt: يظهر اسم WhatsApp والطابع الزمني مع التفريغ الذي يعيده المزوّد المختار.
ملاحظة عن الهندية تحديدًا: إذا كانت الرسالة الصوتية بالهندية المهيمنة بالديوناغري (الهندية الرسمية بأسلوب الكلام المكتوب مع إدراجات إنجليزية ضئيلة)، تكون الدقة قوية باستمرار عبر المستويات المدعومة. تحويل Premium+Voice بـ 49 دولارًا لكل دردشة هو نقطة الدخول الصحيحة لأي رسائل صوتية هندية تريد تفريغها؛ تحويل Power User بـ 99 دولارًا لكل دردشة يغطي نفس الدقة بلا حد للصوت وأولوية القائمة. تحويل Premium بـ 29 دولارًا لكل دردشة يحفظ الرسائل الصوتية كعناصر نائبة فقط — لا تفريغ يعمل في ذلك المستوى.
مستوى Premium+Voice بـ 49 دولارًا — ما يشمله وما لا يشمله

تحويل Premium+Voice بـ 49 دولارًا لكل دردشة هو المستوى الذي بنيتُه تحديدًا للمحادثات الثقيلة بالرسائل الصوتية. إليك بالضبط ما يشمله وما لا يشمله.
ما يشمله تحويل Premium+Voice بـ 49 دولارًا لكل دردشة:
- توجيه واعٍ باللغة — يمكن معالجة كل رسالة مدعومة عبر Deepgram Nova-3 أو ElevenLabs Scribe v2
- سجل من 93 لغة — تقع 57 ضمن فئات دقة منشورة عالية أو ممتازة؛ التغطية لا تضمن نتيجة تسجيل بعينه
- ما يصل إلى 8 ساعات صوتية في دردشة واحدة — يغطي الغالبية العظمى من المحادثات الثقيلة بالصوت؛ إذا تجاوزت دردشتك 8 ساعات إجمالية من الصوت المسجَّل يرفع تحويل Power User بـ 99 دولارًا لكل دردشة هذا الحد
- لا حد للرسائل — لا سقف لعدد الرسائل في الدردشة التي تحوّلها
- نسب المُرسِل في التفريغات — كل تفريغ في PDF يحمل اسم مُرسِل WhatsApp من بيانات التصدير الوصفية
- الطوابع الزمنية محفوظة — الطابع الزمني الأصلي لـ WhatsApp يظهر جنبًا إلى جنب مع كل تفريغ لا وقت التفريغ
- ثلاثة صيغ مخرجات — PDF و XLSX و CSV جميعها مشمولة؛ XLSX مفيد إذا أردت التصفية أو الترتيب حسب المُرسِل والطابع الزمني
- احتفاظ بالملف المصدر لسبعة أيام — مُشفَّر في وضع الراحة (AES-256) وأثناء النقل (TLS 1.3)
ما لا يشمله تحويل Premium+Voice بـ 49 دولارًا لكل دردشة:
- المفردات المتخصصة — لا يقبل المسار الحالي قاموسًا مخصصًا لكل رفع؛ يجب التحقق من الأسماء والاختصارات والمصطلحات النادرة بمقارنتها بالصوت الأصلي
المستوى الأعلى — تحويل Power User بـ 99 دولارًا لكل دردشة — يشمل كل ما في تحويل Premium+Voice بـ 49 دولارًا لكل دردشة بالإضافة إلى معالجة ذات أولوية في القائمة والتعامل مع الدردشات المتعددة. إذا كنت تحوّل دردشة واحدة والسرعة ليست حرجة (تكتمل معظم التحويلات في أقل من ثلاث دقائق)، تحويل Premium+Voice بـ 49 دولارًا لكل دردشة هو المستوى الصحيح.


للمرجعية، مكدّس المستويات الكامل: تحويل Basic بـ 7 دولارات لكل دردشة (نصي فقط، حد 5,000 رسالة)، وتحويل Standard بـ 14 دولارًا (صور، حد 25,000 رسالة)، وتحويل Premium بـ 29 دولارًا (بلا حد منتج للرسائل، XLSX/CSV، الرسائل الصوتية كعناصر نائبة)، وتحويل Premium+Voice بـ 49 دولارًا (موجّه 93 لغة، حد 8 ساعات صوتية)، وتحويل Power User بـ 99 دولارًا (الموجّه نفسه بلا حد لمدة الصوت وقائمة أولوية).
لماذا لا أُفرّغ بشكل فوري (ولن أُضيفه)

هذا يطرح بما يكفي من التكرار لأستحق إجابة مباشرة. يسأل الناس لماذا لا يستمع ChatToPDF للرسائل الصوتية حين تصل — مُفرِّغًا كل منها في لحظة إرسالها — بدلًا من اشتراط تصدير ZIP بعد الواقعة.
الجواب المختصر: WhatsApp لا يُتيح للمطورين الوصول إلى الرسائل الواردة أو الصوت بشكل فوري. لا يوجد نقطة نهاية رسمية في WhatsApp Business API تُظهر الرسائل الصوتية حين وصولها. مسار الوصول الوحيد المدعوم من طرف ثالث هو من خلال آلية "تصدير الدردشة"، وهي لقطة زمنية لسجل المحادثة. بناء تفريغ فوري على WhatsApp سيتطلب اعتراض التخزين المحلي للتطبيق على الجهاز، وهو هش تقنيًا وخارج شروط سياسات منصة WhatsApp.
لكن ثمة سبب أكثر عملية لعدم محاولتي البناء حول هذا القيد. حالة الاستخدام لتفريغ صوت WhatsApp هي بأكملها تقريبًا استرجاعية. شخص استقبل ثلاثين رسالة صوتية خلال نزاع ويريد سجلًا مقروءًا. فريق عمل يستخدم الرسائل الصوتية لتحديثات المشاريع ويحتاجها قابلة للبحث. عائلة ترسل الرسائل الصوتية لسنوات وتريد أرشفتها قبل تغيير الهاتف. لا شيء من هذا يتضمن متطلب "الآن، حال وصوله". جميعها "لديّ مجموعة تسجيلات أحتاج تحويلها".
ثمة أيضًا سؤال البطارية والشبكة. تشغيل اتصال WebSocket مفتوح يُدفق مقاطع صوتية إلى API استنتاج بشكل فوري سيُنهك بطارية الهاتف بشكل ملحوظ خلال محادثة طويلة. سيتطلب اتصالًا إنترنتيًا نشطًا لكل رسالة صوتية مستقبَلة لا فقط حين تختار التحويل. وسيُنشئ تدفقًا مستمرًا لبيانات محادثاتك إلى خادم طرف ثالث — وهو ما لا أشعر بالارتياح لطلب قبول المستخدمين به.
نموذج التصدير والرفع أبطأ في وقت الساعة — يجب أن تنتظر حتى تصبح جاهزًا للتحويل ثم تُجري التصدير ثم ترفع. لكن لحالات الاستخدام الفعلية لدى الناس، هذا بخير. لا أحد يحاول تفريغ رسالة صوتية استلمها قبل ثلاث ثوانٍ لوثيقة فورية. إنهم يحوّلون محادثة يريدون الاحتفاظ بها.
الخصوصية: أين يذهب صوتك وأين لا يذهب

هذا الجزء الذي أريد التحديد فيه لأن طبيعة الرسائل الصوتية — تسجيلات صوتية لمحادثات حقيقية — تعني أن مخاطر الخصوصية أعلى من الرسائل النصية وحدها.
إليك مسار البيانات الدقيق لرسالة صوتية مُقدَّمة عبر تحويل Premium+Voice بـ 49 دولارًا لكل دردشة:
الخطوة 1 — الرفع. يُنقل ملف ZIP من متصفحك إلى خادم ChatToPDF عبر HTTPS (TLS 1.3). الاتصال مُشفَّر أثناء النقل. يصل ZIP إلى دليل معالجة مؤقت لا في التخزين الدائم أثناء الاستخراج.
الخطوة 2 — الاستخراج. تُستخرج ملفات .opus من ZIP. يُطابق كل ملف مع مرجعه في _chat.txt حسب نمط اسم الملف. في هذه المرحلة الملفات الصوتية موجودة فقط على خادم معالجة ChatToPDF.
الخطوة 3 — استدعاء مزوّد التفريغ. يُرسل كل ملف مدعوم عبر HTTPS موثّق إلى المزوّد المختار للرسالة: Deepgram Nova-3 أو ElevenLabs Scribe v2. تتضمن طلبات Deepgram إلغاء الاشتراك في برنامج تحسين النماذج. يتلقى المزوّد الصوت اللازم للتفريغ، لا نص الدردشة كاملًا.
الخطوة 4 — التخزين. يُجمَّع التفريغ في PDF ويُخزَّن مُشفَّرًا في وضع الراحة (AES-256) في AWS S3. ZIP المصدر بما يشمل ملفات .opus يُخزَّن أيضًا مُشفَّرًا لسبعة أيام.
الخطوة 5 — التسليم. رابط تنزيل PDF يظهر على الشاشة وفي بريدك الإلكتروني. الرابط مرتبط بمعرّف عملك. غير قابل للتخمين وغير مفهرس في أي مكان.
الخطوة 6 — الحذف التلقائي. بعد سبعة أيام من إنشاء العمل يُحذف كل من ZIP المصدر و PDF الناتج من التخزين تلقائيًا. هذا وظيفة حذف مجدولة لا عملية يدوية. لا استثناءات ولا تمديدات.
أين لا يذهب صوتك: لا يذهب إلى أي منصة تحليلات. لا يُستخدم لتدريب نماذج ChatToPDF (ChatToPDF لا يُدرّب نماذج). محتوى نص رسائلك الصوتية غير مرئي لموظفي ChatToPDF — المعالجة آلية بالكامل. لا يتلقى أي طرف ثالث نص رسائل محادثتك.
تستحق خطوة المزوّد الخارجي المراجعة في أي تقييم للخصوصية. يتحكم ChatToPDF في مساره، لكن Deepgram وElevenLabs يتحكمان في معالجتهما وفق شروطهما. إذا احتوت الرسائل معلومات مميزة أو منظمة أو شديدة الحساسية، فعلى الفريق المسؤول مراجعة شروط المزوّدين الحالية قبل الرفع.
الحالات الحدية: الضجيج ومتعددو المُتحدثين والتأثيرات الصوتية

الرسائل الصوتية الحقيقية في WhatsApp لا تُسجَّل في استوديوهات معزولة صوتيًا. تُسجَّل في السيارات والمطابخ والاجتماعات في الشارع والمقاهي الصاخبة. إليك كيف يؤثر كل من هذه السيناريوهات في دقة التفريغ، وما يفعله ChatToPDF حين تنخفض الدقة إلى مستوى غير مقبول.
الضجيج الخلفي حسب البيئة.
عادةً ما تكون الرسالة المسجّلة في بيئة داخلية هادئة أسهل من رسالة فيها ضوضاء أو تقطيع أو أصوات متعددة أو تبديل لغوي. لا تتنبأ فئة اللغة المنشورة بنتيجة تسجيل محدد.
متعددو المُتحدثين داخل رسالة صوتية واحدة.
إذا تحدث شخص آخر بوضوح في الخلفية فقد يفرّغ المزوّد المختار ذلك الصوت أيضًا. قد تجمع النتيجة الصوتين تحت مُرسِل WhatsApp، لذا راجع تلك المقاطع بمقارنتها بالصوت.
لا يستطيع ChatToPDF حاليًا عزل المُتحدث الرئيسي وتجاهل الأصوات الخلفية داخل مقطع .opus واحد. تمييز المُتحدثين — تحديد مقاطع الصوت التي جاءت من أي شخص في الملف الصوتي ذاته — ميزة أقيّمها لمستوى مستقبلي، لكنها تتطلب بنية تحتية إضافية وليست في الإصدار الحالي.
التأثيرات الصوتية.
للمقاطع التي تنخفض فيها الثقة دون العتبة التي حددتها في المسار — مُعرَّفة حاليًا بمتوسط درجة ثقة الكلمة أقل من 0.6 عبر المقطع — يُعلّم ChatToPDF التفريغ في PDF كـ [تفريغ منخفض الثقة — جودة الصوت غير كافية] بدلًا من إخراج كتلة نص قد تُؤخذ على أنها موثوقة. ستشاهد هذه العلامة في PDF النهائي جنبًا إلى جنب مع موضع الرسالة الصوتية في المحادثة. من الأفضل الإشارة إلى نتيجة غير مؤكدة من إعادة تفريغ يبدو معقولًا لكنه خاطئ بنسبة 40%.
الأسئلة الشائعة
ما صيغة ملف الرسائل الصوتية في WhatsApp وهل يتعامل معها ChatToPDF؟
يحفظ WhatsApp الرسائل الصوتية عادةً بصوت Opus في ملفات .opus. يستخرج ChatToPDF الصوت المدعوم من ZIP ويرسل كل رسالة بصيغتها الأصلية إلى Deepgram Nova-3 أو ElevenLabs Scribe v2 حسب الموجّه؛ لا حاجة إلى إعادة ترميز مسبقة.
ما مدى دقة تفريغ صوت WhatsApp؟
تعتمد الدقة أساسًا على التسجيل. يستخدم Premium+Voice وPower User موجّه Nova-3/Scribe v2 نفسه؛ يغيّر Power User حد الصوت والأولوية ولا يضمن دقة أعلى. لا يفرّغ Premium بـ 29 دولارًا الصوت. قد تقلل الضوضاء وتداخل الأصوات والتقطيع واللهجات والتبديل اللغوي الجودة، لذا راجع الأسماء والتواريخ والمبالغ والاقتباسات مقابل الصوت الأصلي.
هل يُفرّغ ChatToPDF الرسائل الصوتية بلغات غير الإنجليزية؟
نعم. يستخدم Premium+Voice وPower User موجّهًا واعيًا باللغة بين Deepgram Nova-3 وElevenLabs Scribe v2 لسجل 93 لغة الحالي؛ تقع 57 ضمن فئات دقة منشورة عالية أو ممتازة. يغطي Scribe v2 السجل كاملًا ويغطي Nova-3 مجموعته المدعومة. لا تضمن التغطية كل لهجة أو تسجيل. لا يفرّغ Premium بـ 29 دولارًا الرسائل الصوتية.
هل أحتاج فعل أي شيء مختلف عند التصدير من WhatsApp إذا أردت تفريغات صوتية؟
نعم — خطوة واحدة حرجة. حين تُصدّر محادثتك من WhatsApp اختر "تضمين الوسائط" لا "بدون وسائط". الرسائل الصوتية (ملفات .opus) تُضمَّن في التصدير فقط حين تختار "تضمين الوسائط". إذا صدّرت "بدون وسائط" سيحتوي _chat.txt مراجع مثل <attached: 00000012-AUDIO-2024-03-15-09-22-31.opus> لكن لا ملفات صوتية فعلية. ChatToPDF لا يستطيع تفريغ رسالة صوتية لا يملكها. راجع دليل تصدير محادثة WhatsApp للعملية كاملة خطوة بخطوة.
هل ستظهر التفريغات الصوتية في المكان الصحيح في PDF؟
نعم. يقرأ ChatToPDF سجل الرسائل في _chat.txt ليفهم بنية المحادثة، يُطابق كل مرجع .opus مع الملف الصوتي المقابل بالاسم، ويُدرج التفريغ في الموضع الدقيق في المحادثة حيث أُرسلت الرسالة الصوتية. اسم المُرسِل من بيانات WhatsApp الوصفية والطابع الزمني الأصلي يظهران جنبًا إلى جنب مع التفريغ. المخرج وثيقة واحدة تتناوب فيها الرسائل النصية وتفريغات الرسائل الصوتية بالترتيب الزمني الصحيح.
ماذا يحدث لملفاتي الصوتية بعد اكتمال التفريغ؟
تُخزّن الملفات الصوتية مشفّرة في عمل ChatToPDF وتُرسل فقط إلى المزوّد المختار للرسالة: Deepgram أو ElevenLabs. تلغي طلبات Deepgram الاشتراك في برنامج تحسين النماذج. تُجدول إزالة الملفات المصدر والصوت المستخرج والتنزيلات عند سبعة أيام؛ قد يحصل العمل الجاري على مهلة محدودة حتى 24 ساعة. راجع قسم الخصوصية في WhatsApp to PDF.
هل يستطيع ChatToPDF تمييز شخصين مختلفين يتحدثان في نفس الرسالة الصوتية؟
ليس حاليًا. كل رسالة صوتية في WhatsApp تُنسب للشخص الذي أرسلها باستخدام معلومات المُرسِل من _chat.txt. داخل رسالة صوتية واحدة إذا تحدث كل من المُرسِل وشخص آخر (مثلًا المُرسِل يُجري محادثة هاتفية أثناء التسجيل)، يُفرَّغ الصوتان لكن يُنسبان لمُرسِل WhatsApp. ChatToPDF لا يُجري حاليًا تمييز المُتحدثين داخل المقاطع الصوتية الفردية. للرسائل الصوتية التي تسمع فيها أصوات خلفية ومفهومة، قد ترى كلامًا متشابكًا في التفريغ.

لسير عمل الدردشة إلى PDF الكامل — بما يشمل كيفية التصدير على iPhone و Android وما يحتويه ZIP وكيف تقارن المستويات الخمسة للتحويلات غير الصوتية — راجع دليل WhatsApp to PDF. إذا كنت على Android وتحتاج نقل التصدير إلى جهاز مختلف قبل الرفع، يغطي دليل نقل WhatsApp من Android إلى iPhone تلك العملية.
I'm Paul, the founder of ChatToPDF. I built it after needing a long WhatsApp conversation as a readable PDF for a legal matter. I test and document WhatsApp exports, PDF conversion, voice-note transcription, and the limits people should check before relying on the result.

