تحويل PDF

تحويل PDF عربي إلى Word: لماذا تتقطع الحروف وكيف تصلحها

الحروف العربية متقطعة أو النص معكوس بعد تحويل PDF إلى Word؟ افهم السبب، وشخّص ملفك في دقيقة، وأصلح النتيجة بخطوات عملية.

تحويل PDF عربي إلى Word: لماذا تتقطع الحروف وكيف تصلحها

تفتح ملف PDF عربياً يبدو سليماً تماماً على الشاشة، ثم تحوّله إلى Word فتجد الحروف العربية متقطعة بعد التحويل، أو الكلمات مقلوبة، أو رموزاً غريبة لا معنى لها. السبب في أغلب الحالات ليس برنامج Word ولا الأداة التي استعملتها وحدها، بل الطريقة التي خُزّن بها النص العربي داخل ملف PDF نفسه. هذا الدليل يشرح ما يحدث خلف الشاشة، وكيف تشخّص الملف في دقيقة قبل تحويله، وما الذي يمكن إصلاحه فعلاً وما الذي لا يمكن.

لن نكرر هنا المقارنة العامة بين الصيغتين (تجدها في مقال PDF أم DOCX)، ولا شرح التعرف الضوئي على الحروف للملفات الممسوحة. التركيز هنا على مشاكل طبقة النص العربي تحديداً، مع تجربة أجريناها بأنفسنا ونتائجها كما ظهرت.

الإجابة السريعة

قبل تحويل PDF عربي إلى Word، انسخ جملة من الملف والصقها في محرر نصوص بسيط، ثم ابحث بـ Ctrl+F داخل قارئ PDF عن كلمة عربية تراها أمامك. إن ظهرت الجملة سليمة ووجد البحث الكلمة، فالتحويل سيعطيك نصاً قابلاً للتعديل يحتاج مراجعة خفيفة. وإن ظهرت مقلوبة أو متقطعة أو رموزاً، فالعيب في طبقة النص داخل الملف، ولن يصلحه أي محوّل بالكامل: الحل الأضمن هو طلب ملف Word الأصلي، وإلا فإعادة استخراج النص بالتعرف الضوئي (OCR). أداة PDF إلى نص تعطيك في ثوانٍ فكرة عمّا سيراه أي محوّل في ملفك.

كيف يخزّن ملف PDF النص العربي

عندما تكتب في Word، يحفظ الملف حروفاً: لكل حرف رمز Unicode واحد، فحرف الكاف هو الكاف نفسه سواء جاء في أول الكلمة أو وسطها أو آخرها. البرنامج هو الذي يقرر شكل الحرف ويصله بما قبله وما بعده لحظة العرض. هذه العملية تسمى «التشكيل الحرفي» أو shaping.

ملف PDF يعمل بطريقة مختلفة. هو لا يخزّن حروفاً بل رسوماً للحروف (glyphs): تعليمات من نوع «ارسم الشكل رقم 412 من الخط الفلاني في هذا الموضع من الصفحة». والتشكيل الحرفي يكون قد تم مسبقاً، في البرنامج الذي أنشأ الملف: هو من اختار الشكل الأولي أو الوسطي أو النهائي أو المنفصل لكل حرف، وهو من رسم «لا» كشكل واحد مدموج. النتيجة أن الصفحة تبدو صحيحة، لكن ما في الملف أشكال جاهزة لا حروف.

لكي يستطيع قارئ PDF أو محوّل أن يعيد هذه الأشكال إلى حروف قابلة للنسخ والبحث، يحتاج إلى جدول ترجمة مرفق بكل خط، اسمه ToUnicode. هذا الجدول يقول مثلاً: الشكل 412 هو الحرف «ك»، والشكل 97 هو «ل» ثم «ا». البرامج الحديثة تضيف هذا الجدول عند التصدير، فيخرج النص سليماً. أما إذا غاب الجدول أو كان ناقصاً أو خاطئاً، فيضطر القارئ إلى التخمين من أسماء الأشكال أو من ترميز الخط، وكثيراً ما يفشل التخمين مع العربية، فتظهر حروف لاتينية عشوائية أو مربعات فارغة.

وهناك مسألتان أخريان تخصّان العربية:

الأعراض وأسبابها المحتملة

شكل الخطأ في ملف Word الناتج يدلك غالباً على سببه. هذا الجدول يجمع أكثر الحالات شيوعاً:

العَرَضالسبب المحتملما يمكن تجربته
حروف منفصلة أو غير متصلة، أو كلمات لا يجدها البحث رغم أنها تبدو صحيحةالنص مخزّن بأشكال العرض (U+FB50–FDFF وU+FE70–FEFF) بدل الحروف العاديةتوحيد النص بصيغة NFKC، أو طلب الملف الأصلي
النص العربي معكوس: الكلمات أو حروف الكلمة بترتيب مقلوبالملف خزّن النص بترتيب العرض البصري، ولم يُستعد ترتيب القراءةالملف الأصلي، أو OCR إن كان النص طويلاً
«لا» تخرج «ال» داخل الكلمةطريقة تخزين الشكل المدموج لام-ألف في ذلك الملفالبحث عن الكلمات التي فيها «لا» وتصحيحها يدوياً
رموز لاتينية عشوائية أو مربعات فارغةجدول ToUnicode غائب أو معطوب، أو خط بترميز خاصOCR على صور الصفحات، أو الملف الأصلي
الحركات (التشكيل) في غير موضعها أو مفقودةالحركات أشكال مستقلة موضوعة فوق الحرف، وقد تُقرأ منفصلة عنهمراجعة يدوية، خصوصاً في النصوص المشكولة
الأرقام والكلمات اللاتينية تقفز إلى مكان آخر في السطراتجاه الفقرة في Word، أو أرقام مخزّنة معكوسة في الملفضبط الفقرة من اليمين إلى اليسار، ثم مراجعة الأرقام
مسافة زائدة قبل الفاصلة أو بين أجزاء الكلمةالنص مقسّم في الملف إلى قطع، والمحوّل يضع مسافة بين القطع«بحث واستبدال» في Word
لا شيء على الإطلاقالملف ممسوح ضوئياً: صفحاته صورOCR

انتبه إلى أن عرضين أو ثلاثة قد تجتمع في الملف نفسه. الملفات المصدّرة من برامج تصميم قديمة مثلاً تجمع غالباً بين أشكال العرض والترتيب البصري.

تشخيص سريع في دقيقة قبل التحويل

لا تنتظر أن تحوّل ملفاً من 40 صفحة لتكتشف أن نصه معطوب. هذه الفحوص لا تأخذ أكثر من دقيقة:

  1. انسخ والصق في محرر بسيط. حدد جملة عربية فيها كلمة تحتوي «لا» وبعض الأرقام، وانسخها إلى المفكرة (Notepad) في ويندوز أو محرر نصوص عادي. المحرر البسيط لا يجمّل النص، فترى ما في الملف كما هو: هل الحروف متصلة؟ هل ترتيب الكلمات صحيح؟ هل الأرقام سليمة؟
  2. ابحث بـ Ctrl+F. داخل قارئ PDF، ابحث عن كلمة عربية تراها بوضوح في الصفحة. إن لم يجدها البحث، فالنص إما صورة، وإما مخزّن بأشكال العرض أو بترميز معطوب.
  3. اطّلع على الخطوط ومصدر الملف. في Adobe Acrobat Reader تجد قائمة الخطوط في خصائص المستند (File ثم Properties، تبويب Fonts)، مع إشارة إلى كون الخط مضمّناً. خطوط معروفة مضمّنة علامة جيدة، وغياب أي خط علامة على ملف ممسوح. وأداة معلومات PDF تعرض حقل «المنتج»، أي البرنامج الذي أنشأ الملف؛ برنامج تصميم أو نشر قديم يعني أن تتوقع مشاكل.
  4. جرّب أداة PDF إلى نص. هي تقرأ طبقة النص الموجودة فقط، بالمكتبة نفسها (pdf.js) التي تعتمد عليها أداة PDF إلى Word عندنا. ما تراه فيها هو تقريباً ما سيصل إلى ملف Word، بدون أي تنسيق يخفي العيوب. نتيجة فارغة تعني ملفاً ممسوحاً.

إن كنت تعرف قليلاً من البرمجة، فهناك فحص أدق: ابحث في النص المستخرج عن أي رمز يقع في النطاقين U+FB50–U+FDFF أو U+FE70–U+FEFF. وجود عدد كبير منها يؤكد مشكلة أشكال العرض.

تجربتنا: ملف سليم ومع ذلك أخطاء صغيرة

أردنا أن نعرف ماذا يحدث مع ملف عربي «جيد الصنع»، لا مع ملف قديم معطوب. أنشأنا تقريراً عربياً من صفحتين في Word، فيه كلمات بخط عريض وأخرى مائلة وفواصل عربية، وصدّرناه إلى PDF ببرنامج LibreOffice. الخطوط المضمّنة كانت DejaVu Sans وCaladea، ومعها جداول ToUnicode. ثم استخرجنا النص بثلاث طرق: أداة pdftotext من حزمة poppler، وأداة PDF إلى نص، وأداة PDF إلى Word في SmokePDF.

ما وجدناه:

الخلاصة التي نستنتجها من هذه التجربة وحدها، دون تعميم: حتى ملف مصنوع جيداً قد يحمل أخطاء صغيرة مصدرها الأشكال المدموجة. «لا» تُرسم شكلاً واحداً يمثل حرفين، وإعادته إلى حرفين بترتيب صحيح تعتمد على الطريقة التي وصفه بها الملف. ولأن ثلاث أدوات مختلفة أعطت الخطأ نفسه، فهو صفة في الملف لا في محوّل بعينه، وليس شيئاً يستطيع المحوّل أن يخمّنه. النصيحة العملية: بعد كل تحويل، ابحث في Word عن «ال» وعن «لا» داخل الكلمات، وراجع النص قبل اعتماده.

الإصلاح بالترتيب: من الأضمن إلى الأصعب

1. اطلب الملف الأصلي

إن كان الملف قد وصلك من زميل أو إدارة أو مكتب، فاسأل عن نسخة Word أو Google Docs الأصلية. رسالة قصيرة توفّر ساعات من التصحيح، والنص الأصلي خالٍ من كل المشاكل السابقة لأنه لم يمر بمرحلة الأشكال أصلاً.

2. أعد التصدير من المصدر

إن كان المصدر متاحاً لك أو للمرسل لكنه يريد إرسال PDF، فليصدّره من جديد بخيار «حفظ باسم PDF» في Word أو LibreOffice أو Google Docs، مع تضمين الخطوط. هذه البرامج تضيف جداول ToUnicode عادة. بعض طابعات PDF الافتراضية القديمة وبرامج التصميم والنشر القديمة هي التي تنتج غالباً ملفات بلا خرائط نص سليمة. وبعد التصدير، جرّب النسخ واللصق مرة واحدة قبل الإرسال.

3. توحيد أشكال العرض (لمن يرتاح للأدوات التقنية)

إن كانت المشكلة أشكال العرض فقط، فهناك حل تقني معروف: تطبيق «التوحيد» على النص بصيغة Unicode تسمى NFKC. هذه العملية تحوّل كل شكل عرض إلى الحرف العادي المقابل له، وتحوّل الشكل المدموج «ﻻ» إلى لام ثم ألف. في لغة Python مثلاً يكفي سطر واحد باستعمال unicodedata.normalize('NFKC', text)، وهناك محررات نصوص وأدوات أخرى تقدم الوظيفة نفسها.

أما «بحث واستبدال» في Word فليس عملياً هنا، لأن لكل حرف عدة أشكال عرض، فتحتاج إلى عشرات عمليات الاستبدال. وانتبه إلى حدود التوحيد:

4. النص المعكوس

عكس سطر أو سطرين يدوياً ممكن. لكن الملفات المخزّنة بترتيب بصري تعكس غالباً الأرقام والكلمات اللاتينية بطريقة مختلفة عن العربية، فيتعقد الأمر بسرعة. إن كان النص المعكوس يتجاوز بضع فقرات، فطريق OCR (الفقرة 6) يكلف في العادة جهداً أقل.

5. ترتيب النتيجة في Word

حتى عندما يكون النص سليماً، يحتاج ملف Word الناتج إلى بعض الضبط:

6. حين تكون طبقة النص غير قابلة للإصلاح: OCR

إذا كان الناتج رموزاً لا معنى لها، أو نصاً معكوساً على طول الملف، فالأسهل تجاهل طبقة النص كلياً والتعامل مع الصفحات كصور، ثم استخراج النص منها بالتعرف الضوئي. الشكل المرسوم على الصفحة صحيح، والمشكلة كانت في الترجمة فقط. شرحنا شروط نجاح التعرف الضوئي على العربية في دليل OCR. ولنكن واضحين: SmokePDF لا يوفر أداة OCR حالياً، فهذه الخطوة تتم في برنامج آخر يدعم العربية.

تحويل PDF إلى Word بدون تغيير الخط العربي: هل هو ممكن؟

هذا طلب شائع، والجواب الصريح: ليس تماماً. ملف PDF يضمّن عادة جزءاً من الخط فقط، أي الأشكال المستعملة في الوثيقة، وهذا الجزء لا يمكن تثبيته في جهازك ولا يستطيع Word أن يكتب به نصاً جديداً. لكي يظهر الخط نفسه في Word، يجب أن يكون الخط الكامل مثبتاً على جهازك.

الطريقة العملية: اعرف اسم الخط من خصائص المستند كما شرحنا في التشخيص. إن كان من الخطوط التي تأتي مع ويندوز، مثل Arial أو Traditional Arabic أو Simplified Arabic أو Sakkal Majalla، فحدد النص في Word وطبّقه عليه. انتبه إلى أن Word يميّز بين خط النص اللاتيني وخط النص العربي: في نافذة الخط (Ctrl+D) اختر الخط في الجزء الخاص بالنصوص المعقدة (Complex scripts) إن كانت العربية مفعّلة في Office. وإن كان الخط تجارياً غير مثبت عندك، فاختر خطاً قريباً منه، أو اشترِ ترخيصه إن كان الشكل مهماً.

وتذكّر أن الخط ليس كل شيء: التباعد والهوامش وتقسيم الأسطر لن تطابق الأصل حتى مع الخط الصحيح، لأن Word يعيد توزيع النص بطريقته.

ما الذي تفعله أداة PDF إلى Word في SmokePDF مع العربية

من الأفضل أن تعرف بالضبط ما تفعله أداة PDF إلى Word وما لا تفعله:

جربنا ذلك على ملف ثانٍ صنعناه عمداً بالمشكلة: سطران عربيان مخزّنان بـ 44 رمزاً من أشكال العرض. خرج النص من أداتي PDF إلى نص وPDF إلى Word حروفاً عادية بترتيب قراءة صحيح، مثل «المبلغ الإجمالي هو 450 درهم»، وخرجت فقرات Word من اليمين إلى اليسار. هذه نتيجة ملف اختبار واحد، لا وعد بكل الملفات.

أما ما لا تصلحه الأداة فمهم بالقدر نفسه: لا تصلح جداول ToUnicode المعطوبة، ولا تبادل اللام والألف الذي رأيناه في «الختبار»، لأنه صفة في الملف نفسه. وترتيب القراءة تعيد بناءه مكتبة pdf.js التي تقرأ الملف، فقد ينجح في ملف ويخطئ في ملف آخر مخزّن بترتيب بصري معقد. والملف الممسوح تخبرك الأداة أنها لم تجد فيه نصاً قابلاً للاستخراج، ولا توجد فيها خاصية OCR. ولمقارنة أي محوّل آخر بمعايير واضحة، راجع دليل اختيار محوّل PDF مجاني.

الأسئلة الشائعة

لماذا يظهر النص سليماً في قارئ PDF ثم يخرج مقلوباً عند النسخ؟

لأن العرض والنسخ عمليتان مختلفتان. القارئ يرسم الأشكال في مواضعها، فتبدو الصفحة صحيحة دائماً، أما النسخ فيعتمد على طبقة النص وجداول الترجمة. إن كانت هذه الطبقة مخزّنة بترتيب بصري أو بلا جدول ToUnicode، فالنسخ يكشف ما لا تكشفه الشاشة.

هل يحل Word المشكلة إذا فتحت ملف PDF فيه مباشرة؟

النسخ الحديثة من Word تستطيع فتح ملفات PDF وتحويلها، وقد تحافظ على التخطيط بشكل أفضل من محوّل نصي بسيط. لكنها تعتمد على طبقة النص نفسها، فإن كانت الحروف غير قابلة للاسترجاع في الملف، فلن تظهر سليمة في Word أيضاً.

ملفي فيه أسطر عربية وأخرى فرنسية، ماذا أتوقع؟

في أداة PDF إلى Word، كل سطر فيه حرف عربي يُضبط من اليمين إلى اليسار، والسطر الفرنسي الخالص يبقى من اليسار إلى اليمين. المشكلة تظهر عادة في السطر المختلط، فراجع فيه مواضع الكلمات الفرنسية والأرقام وعلامات الترقيم بعد التحويل.

هل OCR أفضل دائماً من طبقة نص فيها أخطاء؟

لا. إن كانت الأخطاء قليلة، مثل مسافات زائدة أو بضع كلمات فيها «لا»، فالمراجعة اليدوية أسرع وأدق، لأن التعرف الضوئي يضيف أخطاءه الخاصة كالخلط بين الحروف المتشابهة في النقاط. استعمل OCR حين يكون أغلب النص رموزاً أو معكوساً.

كيف أرسل وثيقة عربية بحيث يمكن تحويلها إلى Word لاحقاً بلا مشاكل؟

صدّرها إلى PDF من Word أو LibreOffice أو Google Docs، وجرّب النسخ واللصق قبل الإرسال. وإن استعملت أداة Word إلى PDF عندنا، فاختر «حفظ بنص قابل للتحديد» عبر نافذة الطباعة، لأن التحميل المباشر يحفظ الصفحات كصور لا يمكن استخراج نصها.

الخلاصة

ملف PDF يحفظ أشكال الحروف العربية لا الحروف نفسها، ونجاح تحويله إلى Word يتوقف على جودة الجداول التي تعيد الأشكال إلى حروف وعلى الترتيب الذي خُزّن به النص. افحص الملف في دقيقة قبل تحويله، واطلب الأصل كلما استطعت، وراجع دائماً الكلمات التي فيها «لا» والفواصل والأرقام بعد التحويل. وحين تكون طبقة النص معطوبة من الأساس، فلا يوجد محوّل يخمّن الحروف الصحيحة، والطريق المتبقي هو التعرف الضوئي على صور الصفحات.

عبد الإله برباش

عبد الإله برباش

المؤسس ومحرر المحتوى التقني

عبد الإله برباش مؤسس SmokePDF ومطوّر أدواته التي تعمل داخل المتصفح. يكتب أدلة عملية عن ضغط ملفات PDF وتحويلها ودمجها وحمايتها، انطلاقاً من طريقة عمل أدوات الموقع نفسها وتجربتها على مستندات حقيقية. يكتب بالعربية والإنجليزية.