ما هو ملف PDF القابل للبحث؟
ملف PDF الممسوح ضوئيًا هو في الحقيقة سلسلة صور لصفحات — "النص" الذي تراه هو بكسلات لا حروف، فلا يمكنك تحديده أو البحث فيه. جعله قابلًا للبحث يضيف طبقة نص فعلي غير مرئية أسفله، بموضع مطابق للصورة، دون تغيير شكل الصفحة.
لماذا ملفات PDF الممسوحة غير قابلة للبحث افتراضيًا
ينتج الماسح الضوئي (أو تطبيق كاميرا هاتف يُصدِر PDF) صورة، ثم يُغلِّف تلك الصورة في حاوية PDF. لا توجد بيانات نصية في أي مكان بالملف — لا يجد Ctrl+F شيئًا لأنه لا يوجد شيء ليجده، مع أن الكلمات واضحة بصريًا لأي إنسان يقرأ الصفحة.
كيف يعمل الحل
يقرأ التعرف الضوئي على الحروف (OCR) الصورة ويحدد الحروف المطبوعة عليها فعليًا مع موضعها. تضيف أداة "جعل قابل للبحث" في FileBench ذلك النص المُتعرَّف عليه كطبقة غير مرئية، بموضع مطابق تمامًا للكلمات المقابلة في الصورة — تبدو الصفحة المرئية مطابقة، لكن Ctrl+F وتحديد النص والنسخ واللصق تعمل الآن مقابل النص الفعلي المُتعرَّف عليه أسفلها.
اللغة مهمة
يجب أن يعرف OCR أي لغة (أو لغات) يبحث عنها. تدعم أداة "جعل قابل للبحث" في FileBench الإنجليزية أو العربية أو كلتيهما في المستند نفسه — اختيار اللغة الخاطئة (أو تفويت واحدة، لصفحة ثنائية اللغة) يقلل الدقة لأن محرك OCR يبحث عن أشكال حروف خاطئة.
هل يغيّر جعل PDF قابلًا للبحث شكله؟
لا — طبقة النص المضافة غير مرئية. تبدو الصفحة بصريًا مطابقة للمسح الأصلي؛ الجديد فقط هو النص القابل للتحديد أسفلها.
هل ملف PDF القابل للبحث هو نفسه القابل للتحرير؟
ليس تمامًا — القابل للبحث يعني أنه يمكنك إيجاد وتحديد/نسخ النص. تحرير محتوى الصفحة الفعلي (بخلاف طبقة النص غير المرئية) لا يزال غير ممكن كما في مستند Word، لأن الصفحة المرئية لا تزال صورة ثابتة.