تفتح ملف PDF عربياً يبدو سليماً تماماً على الشاشة، ثم تحوّله إلى Word فتجد الحروف العربية متقطعة بعد التحويل، أو الكلمات مقلوبة، أو رموزاً غريبة لا معنى لها. السبب في أغلب الحالات ليس برنامج Word ولا الأداة التي استعملتها وحدها، بل الطريقة التي خُزّن بها النص العربي داخل ملف PDF نفسه. هذا الدليل يشرح ما يحدث خلف الشاشة، وكيف تشخّص الملف في دقيقة قبل تحويله، وما الذي يمكن إصلاحه فعلاً وما الذي لا يمكن.
لن نكرر هنا المقارنة العامة بين الصيغتين (تجدها في مقال PDF أم DOCX)، ولا شرح التعرف الضوئي على الحروف للملفات الممسوحة. التركيز هنا على مشاكل طبقة النص العربي تحديداً، مع تجربة أجريناها بأنفسنا ونتائجها كما ظهرت.
الإجابة السريعة
قبل تحويل PDF عربي إلى Word، انسخ جملة من الملف والصقها في محرر نصوص بسيط، ثم ابحث بـ Ctrl+F داخل قارئ PDF عن كلمة عربية تراها أمامك. إن ظهرت الجملة سليمة ووجد البحث الكلمة، فالتحويل سيعطيك نصاً قابلاً للتعديل يحتاج مراجعة خفيفة. وإن ظهرت مقلوبة أو متقطعة أو رموزاً، فالعيب في طبقة النص داخل الملف، ولن يصلحه أي محوّل بالكامل: الحل الأضمن هو طلب ملف Word الأصلي، وإلا فإعادة استخراج النص بالتعرف الضوئي (OCR). أداة PDF إلى نص تعطيك في ثوانٍ فكرة عمّا سيراه أي محوّل في ملفك.
كيف يخزّن ملف PDF النص العربي
عندما تكتب في Word، يحفظ الملف حروفاً: لكل حرف رمز Unicode واحد، فحرف الكاف هو الكاف نفسه سواء جاء في أول الكلمة أو وسطها أو آخرها. البرنامج هو الذي يقرر شكل الحرف ويصله بما قبله وما بعده لحظة العرض. هذه العملية تسمى «التشكيل الحرفي» أو shaping.
ملف PDF يعمل بطريقة مختلفة. هو لا يخزّن حروفاً بل رسوماً للحروف (glyphs): تعليمات من نوع «ارسم الشكل رقم 412 من الخط الفلاني في هذا الموضع من الصفحة». والتشكيل الحرفي يكون قد تم مسبقاً، في البرنامج الذي أنشأ الملف: هو من اختار الشكل الأولي أو الوسطي أو النهائي أو المنفصل لكل حرف، وهو من رسم «لا» كشكل واحد مدموج. النتيجة أن الصفحة تبدو صحيحة، لكن ما في الملف أشكال جاهزة لا حروف.
لكي يستطيع قارئ PDF أو محوّل أن يعيد هذه الأشكال إلى حروف قابلة للنسخ والبحث، يحتاج إلى جدول ترجمة مرفق بكل خط، اسمه ToUnicode. هذا الجدول يقول مثلاً: الشكل 412 هو الحرف «ك»، والشكل 97 هو «ل» ثم «ا». البرامج الحديثة تضيف هذا الجدول عند التصدير، فيخرج النص سليماً. أما إذا غاب الجدول أو كان ناقصاً أو خاطئاً، فيضطر القارئ إلى التخمين من أسماء الأشكال أو من ترميز الخط، وكثيراً ما يفشل التخمين مع العربية، فتظهر حروف لاتينية عشوائية أو مربعات فارغة.
وهناك مسألتان أخريان تخصّان العربية:
- ترتيب الكتابة: العربية تُقرأ من اليمين إلى اليسار، لكن ملف PDF لا يفرض ترتيباً معيناً لتخزين الأشكال. بعض البرامج تخزّنها بترتيب القراءة، وبعضها بترتيب ظهورها على الصفحة من اليسار إلى اليمين. على القارئ أن يعيد بناء ترتيب القراءة، وإن أخطأ خرج النص العربي معكوساً.
- أشكال العرض في Unicode: بعض البرامج تربط الأشكال برموز Unicode خاصة تسمى «أشكال العرض» (presentation forms)، وهي رموز مستقلة لكل شكل من أشكال الحرف، في النطاقين U+FB50–U+FDFF وU+FE70–U+FEFF. تبدو على الشاشة مثل الحروف العادية، لكنها رموز مختلفة: البحث لا يجدها، والتدقيق الإملائي لا يتعرف عليها، وبعض البرامج تعرضها منفصلة.
الأعراض وأسبابها المحتملة
شكل الخطأ في ملف Word الناتج يدلك غالباً على سببه. هذا الجدول يجمع أكثر الحالات شيوعاً:
| العَرَض | السبب المحتمل | ما يمكن تجربته |
|---|---|---|
| حروف منفصلة أو غير متصلة، أو كلمات لا يجدها البحث رغم أنها تبدو صحيحة | النص مخزّن بأشكال العرض (U+FB50–FDFF وU+FE70–FEFF) بدل الحروف العادية | توحيد النص بصيغة NFKC، أو طلب الملف الأصلي |
| النص العربي معكوس: الكلمات أو حروف الكلمة بترتيب مقلوب | الملف خزّن النص بترتيب العرض البصري، ولم يُستعد ترتيب القراءة | الملف الأصلي، أو OCR إن كان النص طويلاً |
| «لا» تخرج «ال» داخل الكلمة | طريقة تخزين الشكل المدموج لام-ألف في ذلك الملف | البحث عن الكلمات التي فيها «لا» وتصحيحها يدوياً |
| رموز لاتينية عشوائية أو مربعات فارغة | جدول ToUnicode غائب أو معطوب، أو خط بترميز خاص | OCR على صور الصفحات، أو الملف الأصلي |
| الحركات (التشكيل) في غير موضعها أو مفقودة | الحركات أشكال مستقلة موضوعة فوق الحرف، وقد تُقرأ منفصلة عنه | مراجعة يدوية، خصوصاً في النصوص المشكولة |
| الأرقام والكلمات اللاتينية تقفز إلى مكان آخر في السطر | اتجاه الفقرة في Word، أو أرقام مخزّنة معكوسة في الملف | ضبط الفقرة من اليمين إلى اليسار، ثم مراجعة الأرقام |
| مسافة زائدة قبل الفاصلة أو بين أجزاء الكلمة | النص مقسّم في الملف إلى قطع، والمحوّل يضع مسافة بين القطع | «بحث واستبدال» في Word |
| لا شيء على الإطلاق | الملف ممسوح ضوئياً: صفحاته صور | OCR |
انتبه إلى أن عرضين أو ثلاثة قد تجتمع في الملف نفسه. الملفات المصدّرة من برامج تصميم قديمة مثلاً تجمع غالباً بين أشكال العرض والترتيب البصري.
تشخيص سريع في دقيقة قبل التحويل
لا تنتظر أن تحوّل ملفاً من 40 صفحة لتكتشف أن نصه معطوب. هذه الفحوص لا تأخذ أكثر من دقيقة:
- انسخ والصق في محرر بسيط. حدد جملة عربية فيها كلمة تحتوي «لا» وبعض الأرقام، وانسخها إلى المفكرة (Notepad) في ويندوز أو محرر نصوص عادي. المحرر البسيط لا يجمّل النص، فترى ما في الملف كما هو: هل الحروف متصلة؟ هل ترتيب الكلمات صحيح؟ هل الأرقام سليمة؟
- ابحث بـ Ctrl+F. داخل قارئ PDF، ابحث عن كلمة عربية تراها بوضوح في الصفحة. إن لم يجدها البحث، فالنص إما صورة، وإما مخزّن بأشكال العرض أو بترميز معطوب.
- اطّلع على الخطوط ومصدر الملف. في Adobe Acrobat Reader تجد قائمة الخطوط في خصائص المستند (File ثم Properties، تبويب Fonts)، مع إشارة إلى كون الخط مضمّناً. خطوط معروفة مضمّنة علامة جيدة، وغياب أي خط علامة على ملف ممسوح. وأداة معلومات PDF تعرض حقل «المنتج»، أي البرنامج الذي أنشأ الملف؛ برنامج تصميم أو نشر قديم يعني أن تتوقع مشاكل.
- جرّب أداة PDF إلى نص. هي تقرأ طبقة النص الموجودة فقط، بالمكتبة نفسها (pdf.js) التي تعتمد عليها أداة PDF إلى Word عندنا. ما تراه فيها هو تقريباً ما سيصل إلى ملف Word، بدون أي تنسيق يخفي العيوب. نتيجة فارغة تعني ملفاً ممسوحاً.
إن كنت تعرف قليلاً من البرمجة، فهناك فحص أدق: ابحث في النص المستخرج عن أي رمز يقع في النطاقين U+FB50–U+FDFF أو U+FE70–U+FEFF. وجود عدد كبير منها يؤكد مشكلة أشكال العرض.
تجربتنا: ملف سليم ومع ذلك أخطاء صغيرة
أردنا أن نعرف ماذا يحدث مع ملف عربي «جيد الصنع»، لا مع ملف قديم معطوب. أنشأنا تقريراً عربياً من صفحتين في Word، فيه كلمات بخط عريض وأخرى مائلة وفواصل عربية، وصدّرناه إلى PDF ببرنامج LibreOffice. الخطوط المضمّنة كانت DejaVu Sans وCaladea، ومعها جداول ToUnicode. ثم استخرجنا النص بثلاث طرق: أداة pdftotext من حزمة poppler، وأداة PDF إلى نص، وأداة PDF إلى Word في SmokePDF.
ما وجدناه:
- لم يظهر أي رمز من أشكال العرض: صفر من أصل 1,845 حرفاً. كل الحروف خرجت حروفاً عادية قابلة للبحث.
- الأسطر وترتيب القراءة من اليمين إلى اليسار كانت صحيحة في المخرجات الثلاثة.
- الكلمات العريضة والمائلة خرجت نصاً عادياً، لأن التنسيق ليس جزءاً من طبقة النص التي نقرؤها.
- لكن كل «لا» في كلمة «لاختبار» خرجت «الختبار»: اللام والألف تبادلتا مكانيهما، وفي المخرجات الثلاثة كلها.
- وظهرت مسافة زائدة قبل بعض الفواصل، مثل «مائلة ،».
الخلاصة التي نستنتجها من هذه التجربة وحدها، دون تعميم: حتى ملف مصنوع جيداً قد يحمل أخطاء صغيرة مصدرها الأشكال المدموجة. «لا» تُرسم شكلاً واحداً يمثل حرفين، وإعادته إلى حرفين بترتيب صحيح تعتمد على الطريقة التي وصفه بها الملف. ولأن ثلاث أدوات مختلفة أعطت الخطأ نفسه، فهو صفة في الملف لا في محوّل بعينه، وليس شيئاً يستطيع المحوّل أن يخمّنه. النصيحة العملية: بعد كل تحويل، ابحث في Word عن «ال» وعن «لا» داخل الكلمات، وراجع النص قبل اعتماده.
الإصلاح بالترتيب: من الأضمن إلى الأصعب
1. اطلب الملف الأصلي
إن كان الملف قد وصلك من زميل أو إدارة أو مكتب، فاسأل عن نسخة Word أو Google Docs الأصلية. رسالة قصيرة توفّر ساعات من التصحيح، والنص الأصلي خالٍ من كل المشاكل السابقة لأنه لم يمر بمرحلة الأشكال أصلاً.
2. أعد التصدير من المصدر
إن كان المصدر متاحاً لك أو للمرسل لكنه يريد إرسال PDF، فليصدّره من جديد بخيار «حفظ باسم PDF» في Word أو LibreOffice أو Google Docs، مع تضمين الخطوط. هذه البرامج تضيف جداول ToUnicode عادة. بعض طابعات PDF الافتراضية القديمة وبرامج التصميم والنشر القديمة هي التي تنتج غالباً ملفات بلا خرائط نص سليمة. وبعد التصدير، جرّب النسخ واللصق مرة واحدة قبل الإرسال.
3. توحيد أشكال العرض (لمن يرتاح للأدوات التقنية)
إن كانت المشكلة أشكال العرض فقط، فهناك حل تقني معروف: تطبيق «التوحيد» على النص بصيغة Unicode تسمى NFKC. هذه العملية تحوّل كل شكل عرض إلى الحرف العادي المقابل له، وتحوّل الشكل المدموج «ﻻ» إلى لام ثم ألف. في لغة Python مثلاً يكفي سطر واحد باستعمال unicodedata.normalize('NFKC', text)، وهناك محررات نصوص وأدوات أخرى تقدم الوظيفة نفسها.
أما «بحث واستبدال» في Word فليس عملياً هنا، لأن لكل حرف عدة أشكال عرض، فتحتاج إلى عشرات عمليات الاستبدال. وانتبه إلى حدود التوحيد:
- اعمل على نسخة، وقارن النتيجة بالأصل.
- NFKC يغيّر رموزاً أخرى أيضاً: رمز «ﷺ» يتحول إلى العبارة الكاملة «صلى الله عليه وسلم»، و«ﷲ» إلى «الله»، وبعض الرموز اللاتينية الخاصة إلى أشكالها البسيطة.
- التوحيد لا يصلح الترتيب. إن كان النص معكوساً أيضاً، فسيبقى معكوساً بحروف عادية.
4. النص المعكوس
عكس سطر أو سطرين يدوياً ممكن. لكن الملفات المخزّنة بترتيب بصري تعكس غالباً الأرقام والكلمات اللاتينية بطريقة مختلفة عن العربية، فيتعقد الأمر بسرعة. إن كان النص المعكوس يتجاوز بضع فقرات، فطريق OCR (الفقرة 6) يكلف في العادة جهداً أقل.
5. ترتيب النتيجة في Word
حتى عندما يكون النص سليماً، يحتاج ملف Word الناتج إلى بعض الضبط:
- اتجاه الفقرة: حدد النص واضغط Ctrl مع Shift الأيمن لجعل الفقرات من اليمين إلى اليسار (Ctrl مع Shift الأيسر للعكس)، وهذا في Word على ويندوز. كثير من «القفزات» في الأرقام تختفي بهذه الخطوة وحدها.
- الأرقام والكلمات اللاتينية: إن بقي رقم أو كلمة في غير مكانها، فالسبب غالباً رمز محايد عند الحدود، مثل القوس أو الشرطة أو الخط المائل. أعد كتابة ذلك الجزء، أو أدرج علامة الاتجاه من اليمين إلى اليسار غير المرئية: اكتب 200F ثم اضغط Alt+X في Word. وتحقق أيضاً من أن الأرقام نفسها غير معكوسة، فـ 2026 قد تصل 6202 من ملف مخزّن بترتيب بصري.
- المسافات الزائدة: في «بحث واستبدال» (Ctrl+H)، ابحث عن مسافة متبوعة بالفاصلة العربية «،» واستبدلها بالفاصلة وحدها، وكرر ذلك مع النقطة والمسافتين المتتاليتين.
- دمج الأسطر: أغلب المحوّلات تجعل كل سطر من PDF فقرة مستقلة، فاجمع الأسطر في فقرات قبل أي تعديل جدي.
6. حين تكون طبقة النص غير قابلة للإصلاح: OCR
إذا كان الناتج رموزاً لا معنى لها، أو نصاً معكوساً على طول الملف، فالأسهل تجاهل طبقة النص كلياً والتعامل مع الصفحات كصور، ثم استخراج النص منها بالتعرف الضوئي. الشكل المرسوم على الصفحة صحيح، والمشكلة كانت في الترجمة فقط. شرحنا شروط نجاح التعرف الضوئي على العربية في دليل OCR. ولنكن واضحين: SmokePDF لا يوفر أداة OCR حالياً، فهذه الخطوة تتم في برنامج آخر يدعم العربية.
تحويل PDF إلى Word بدون تغيير الخط العربي: هل هو ممكن؟
هذا طلب شائع، والجواب الصريح: ليس تماماً. ملف PDF يضمّن عادة جزءاً من الخط فقط، أي الأشكال المستعملة في الوثيقة، وهذا الجزء لا يمكن تثبيته في جهازك ولا يستطيع Word أن يكتب به نصاً جديداً. لكي يظهر الخط نفسه في Word، يجب أن يكون الخط الكامل مثبتاً على جهازك.
الطريقة العملية: اعرف اسم الخط من خصائص المستند كما شرحنا في التشخيص. إن كان من الخطوط التي تأتي مع ويندوز، مثل Arial أو Traditional Arabic أو Simplified Arabic أو Sakkal Majalla، فحدد النص في Word وطبّقه عليه. انتبه إلى أن Word يميّز بين خط النص اللاتيني وخط النص العربي: في نافذة الخط (Ctrl+D) اختر الخط في الجزء الخاص بالنصوص المعقدة (Complex scripts) إن كانت العربية مفعّلة في Office. وإن كان الخط تجارياً غير مثبت عندك، فاختر خطاً قريباً منه، أو اشترِ ترخيصه إن كان الشكل مهماً.
وتذكّر أن الخط ليس كل شيء: التباعد والهوامش وتقسيم الأسطر لن تطابق الأصل حتى مع الخط الصحيح، لأن Word يعيد توزيع النص بطريقته.
ما الذي تفعله أداة PDF إلى Word في SmokePDF مع العربية
من الأفضل أن تعرف بالضبط ما تفعله أداة PDF إلى Word وما لا تفعله:
- تقرأ طبقة النص الموجودة في الملف، صفحة بصفحة، داخل متصفحك. لا يُرفع الملف إلى خوادمنا.
- تجمع قطع النص في أسطر حسب موضعها العمودي على الصفحة، وتضع مسافة بين القطع داخل السطر. لذلك قد تظهر مسافة زائدة حيث كان النص مقسّماً في الملف.
- تكتب كل سطر فقرة مستقلة في ملف .docx حقيقي، مع فاصل صفحة بين الصفحات، وتجعل أول سطر قصير في الصفحة عنواناً.
- تحوّل أشكال العرض (U+FB50–FDFF وU+FE70–FEFF) إلى الحروف العادية المقابلة لها بتوحيد NFKC، وهو الحل نفسه الموصوف أعلاه، فيصبح النص قابلاً للبحث والتدقيق. وتفعل أداة PDF إلى نص الشيء نفسه.
- كل سطر يحتوي حروفاً عربية يُضبط من اليمين إلى اليسار ومحاذياً لليمين. والخط المستعمل في الملف الناتج هو Arial، لا الخط الأصلي.
- لا تنقل الصور ولا بنية الجداول ولا الأعمدة ولا الألوان، ولا التنسيق العريض والمائل.
جربنا ذلك على ملف ثانٍ صنعناه عمداً بالمشكلة: سطران عربيان مخزّنان بـ 44 رمزاً من أشكال العرض. خرج النص من أداتي PDF إلى نص وPDF إلى Word حروفاً عادية بترتيب قراءة صحيح، مثل «المبلغ الإجمالي هو 450 درهم»، وخرجت فقرات Word من اليمين إلى اليسار. هذه نتيجة ملف اختبار واحد، لا وعد بكل الملفات.
أما ما لا تصلحه الأداة فمهم بالقدر نفسه: لا تصلح جداول ToUnicode المعطوبة، ولا تبادل اللام والألف الذي رأيناه في «الختبار»، لأنه صفة في الملف نفسه. وترتيب القراءة تعيد بناءه مكتبة pdf.js التي تقرأ الملف، فقد ينجح في ملف ويخطئ في ملف آخر مخزّن بترتيب بصري معقد. والملف الممسوح تخبرك الأداة أنها لم تجد فيه نصاً قابلاً للاستخراج، ولا توجد فيها خاصية OCR. ولمقارنة أي محوّل آخر بمعايير واضحة، راجع دليل اختيار محوّل PDF مجاني.
الأسئلة الشائعة
لماذا يظهر النص سليماً في قارئ PDF ثم يخرج مقلوباً عند النسخ؟
لأن العرض والنسخ عمليتان مختلفتان. القارئ يرسم الأشكال في مواضعها، فتبدو الصفحة صحيحة دائماً، أما النسخ فيعتمد على طبقة النص وجداول الترجمة. إن كانت هذه الطبقة مخزّنة بترتيب بصري أو بلا جدول ToUnicode، فالنسخ يكشف ما لا تكشفه الشاشة.
هل يحل Word المشكلة إذا فتحت ملف PDF فيه مباشرة؟
النسخ الحديثة من Word تستطيع فتح ملفات PDF وتحويلها، وقد تحافظ على التخطيط بشكل أفضل من محوّل نصي بسيط. لكنها تعتمد على طبقة النص نفسها، فإن كانت الحروف غير قابلة للاسترجاع في الملف، فلن تظهر سليمة في Word أيضاً.
ملفي فيه أسطر عربية وأخرى فرنسية، ماذا أتوقع؟
في أداة PDF إلى Word، كل سطر فيه حرف عربي يُضبط من اليمين إلى اليسار، والسطر الفرنسي الخالص يبقى من اليسار إلى اليمين. المشكلة تظهر عادة في السطر المختلط، فراجع فيه مواضع الكلمات الفرنسية والأرقام وعلامات الترقيم بعد التحويل.
هل OCR أفضل دائماً من طبقة نص فيها أخطاء؟
لا. إن كانت الأخطاء قليلة، مثل مسافات زائدة أو بضع كلمات فيها «لا»، فالمراجعة اليدوية أسرع وأدق، لأن التعرف الضوئي يضيف أخطاءه الخاصة كالخلط بين الحروف المتشابهة في النقاط. استعمل OCR حين يكون أغلب النص رموزاً أو معكوساً.
كيف أرسل وثيقة عربية بحيث يمكن تحويلها إلى Word لاحقاً بلا مشاكل؟
صدّرها إلى PDF من Word أو LibreOffice أو Google Docs، وجرّب النسخ واللصق قبل الإرسال. وإن استعملت أداة Word إلى PDF عندنا، فاختر «حفظ بنص قابل للتحديد» عبر نافذة الطباعة، لأن التحميل المباشر يحفظ الصفحات كصور لا يمكن استخراج نصها.
الخلاصة
ملف PDF يحفظ أشكال الحروف العربية لا الحروف نفسها، ونجاح تحويله إلى Word يتوقف على جودة الجداول التي تعيد الأشكال إلى حروف وعلى الترتيب الذي خُزّن به النص. افحص الملف في دقيقة قبل تحويله، واطلب الأصل كلما استطعت، وراجع دائماً الكلمات التي فيها «لا» والفواصل والأرقام بعد التحويل. وحين تكون طبقة النص معطوبة من الأساس، فلا يوجد محوّل يخمّن الحروف الصحيحة، والطريق المتبقي هو التعرف الضوئي على صور الصفحات.