OCR للصور — استخراج النص من الصور
استخرج نصاً قابلاً للتحرير من صور PNG وJPG وJPEG وWebP مباشرة داخل متصفحك.
OCR للصور — استخراج النص من الصور
تتم معالجة الصورة المحددة داخل متصفحك ولا يتم رفعها إلى CyberTools لإجراء OCR. قد يقوم المتصفح بتنزيل محرك OCR وملفات اللغة المطلوبة للتعرّف.
استخدم صورة واضحة ومستقيمة بنص حاد وتباين جيد. قد تقل الدقة مع النص الصغير أو الضبابي أو المائل أو المزخرف.
OCR مجاني للصور — استخراج النص من الصور عبر الإنترنت
تتيح أداة OCR للصور من CyberTools تحويل النص الظاهر داخل الصورة إلى نص قابل للتحرير مباشرة في متصفحك. يمكنك اختيار صورة بصيغة PNG أو JPG أو JPEG أو WebP، ثم تحديد لغة التعرّف، وتشغيل تقنية التعرّف البصري على الحروف، وبعد ذلك نسخ النص الناتج أو تنزيله كملف نصي TXT.
تتم عملية OCR داخل المتصفح باستخدام Tesseract.js. لا يتم رفع الصورة التي اخترتها إلى CyberTools بغرض التعرّف على النص. ومع ذلك، قد يحتاج المتصفح إلى تنزيل ملفات المحرك وبيانات اللغة المطلوبة عند استخدامها لأول مرة.
تكون الأداة مفيدة عند استخراج نصوص من لقطات الشاشة والمستندات الممسوحة ضوئياً والصور الملتقطة بالكاميرا والإيصالات والملصقات والنماذج وشرائح العروض وغيرها من الصور التي تحتوي على نص مطبوع قابل للقراءة. تقنية OCR ليست معصومة من الخطأ، لذلك ينبغي دائماً مقارنة المعلومات المهمة بالصورة الأصلية.
كيفية استخراج النص من صورة
- 1 اختر صورة بصيغة PNG أو JPG أو JPEG أو WebP أو اسحبها إلى مساحة OCR.
- 2 تحقق من معاينة الصورة واسم الملف والأبعاد والحجم قبل بدء المعالجة.
- 3 اختر اللغة التي تتطابق بصورة أفضل مع النص الموجود داخل الصورة.
- 4 اضغط على استخراج النص وانتظر بينما يقوم محرك OCR بتحليل الصورة داخل متصفحك.
- 5 راجع النص المستخرج وصحح أي أخطاء ثم انسخه أو نزّله كملف TXT.
ما هو OCR للصور؟
OCR هو اختصار لعبارة التعرّف البصري على الحروف. تقوم برمجيات OCR بتحليل الأشكال والأنماط الموجودة في الصورة ومحاولة تفسيرها على أنها حروف وأرقام وعلامات ترقيم وكلمات. وتكون النتيجة نصاً قابلاً للقراءة آلياً يمكن تحديده وتحريره والبحث فيه وإعادة استخدامه.
لا تقوم تقنية OCR بمجرد نسخ طبقة نص مخفية من صورة عادية. ملفات PNG وJPEG تحتوي عادةً على بكسلات وليس كلمات قابلة للتحرير، ولذلك يجب على محرك التعرّف تفسير تلك البكسلات وتقدير الحروف التي تمثلها. لهذا تؤثر جودة الصورة واللغة والخط والاتجاه والتباين وتصميم الصفحة في مستوى الدقة.
لغات التعرّف المدعومة في OCR
تعرض أداة CyberTools حالياً خيارات للتعرّف على الإنجليزية والعربية والألمانية والإسبانية والفرنسية والهندية والإندونيسية واليابانية والكورية والبرتغالية والتركية. لغة التعرّف تحدد نموذج اللغة الذي يستخدمه محرك OCR، وهي مستقلة عن لغة واجهة CyberTools.
اختر اللغة المطابقة للنص داخل الصورة. فعلى سبيل المثال، استخدام واجهة CyberTools باللغة العربية لا يعني أن لقطة شاشة باللغة الإنجليزية يجب تحليلها كعربية. اختر الإنجليزية للنص الإنجليزي والعربية للنص العربي واليابانية للنص الياباني وهكذا.
قد تكون ملفات بيانات اللغة كبيرة نسبياً، لذلك قد تستغرق أول عملية OCR بلغة معينة وقتاً أطول بينما يقوم المتصفح بتجهيز المحرك والحصول على بيانات التعرّف اللازمة.
كيفية تحسين دقة OCR
تعمل تقنية OCR بصورة أفضل عندما تكون الحروف واضحة وسهلة التمييز. لتحسين النتائج اتبع الإرشادات التالية:
- 1 استخدم صورة حادة وواضحة تظهر فيها الحروف بشكل يمكن تمييزه.
- 2 حافظ على النص مستقيماً قدر الإمكان وتجنب الميل الشديد أو الدوران.
- 3 استخدم صوراً ذات تباين قوي بين النص والخلفية.
- 4 تجنب الضبابية والوهج والظلال وآثار الضغط الشديدة والنصوص الصغيرة جداً.
- 5 اقصص العناصر المرئية غير الضرورية عندما تتداخل مع منطقة النص.
- 6 اختر لغة التعرّف الصحيحة للنص الذي تريد استخراجه.
- 7 قارن الأسماء والتواريخ والمبالغ المالية والأرقام المرجعية المهمة بالصورة الأصلية بعد OCR.
قد يخلط OCR بين الحروف أو الأرقام المتشابهة بصرياً، مثل الرقم صفر والحرف O أو الرقم واحد والحرف الصغير l. وتزداد احتمالية هذه الأخطاء مع الصور منخفضة الدقة والخطوط المزخرفة.
صيغ الصور المدعومة وحدود الأمان في المتصفح
تقبل مساحة OCR الحالية في CyberTools صور PNG وJPG وJPEG وWebP. حد الأمان داخل المتصفح هو 20 ميجابايت لكل ملف يتم اختياره و25 ميجابكسل للصورة بعد فك ترميزها.
حجم الملف وحجم الصورة بعد فك الترميز شيئان مختلفان. قد يكون ملف JPEG المضغوط بضعة ميجابايت فقط على القرص، لكنه يحتاج إلى ذاكرة أكبر بكثير بعد فك الضغط. كما يحتاج محرك OCR إلى ذاكرة إضافية أثناء عملية التعرّف، ولذلك قد تستهلك الصور الضخمة موارد كبيرة على الهواتف والأجهزة ذات الذاكرة المحدودة.
| صيغ الإدخال | PNG وJPG وJPEG وWebP |
|---|---|
| الحد الأقصى لحجم الملف | 20 ميجابايت |
| الحد الأقصى للصورة بعد فك الترميز | 25 ميجابكسل |
| طريقة المعالجة | OCR داخل المتصفح |
| الإخراج | نص قابل للتحرير وتنزيل TXT |
| هل يلزم حساب؟ | لا |
الخصوصية والمعالجة داخل المتصفح
تتم معالجة الصورة الأصلية المحددة محلياً داخل المتصفح لإجراء OCR بدلاً من رفعها إلى نقطة معالجة على خوادم CyberTools. وهذا مفيد عندما لا تريد إرسال الصورة إلى خادم تحويل تابع للموقع.
لكن عبارة "داخل المتصفح" لا تعني أن الصفحة لا تنفذ أي اتصالات شبكية إطلاقاً. قد يقوم المتصفح بجلب مكتبة Tesseract وملفات اللغة المدربة عند الحاجة إليها. النقطة المهمة هي أن الصورة التي اخترتها للتعرّف تتم معالجتها ضمن سير عمل OCR في المتصفح.
عند التعامل مع مستندات شديدة الحساسية، ضع في الاعتبار أمان جهازك ومتصفحك والإضافات المثبتة وبيئة الشبكة ومتطلبات مؤسستك الأمنية قبل معالجة المستند.
النص المطبوع مقارنة بالكتابة اليدوية
تكون أدوات OCR العامة أكثر موثوقية مع النصوص المطبوعة أو النصوص الرقمية الواضحة. تختلف الكتابة اليدوية بشكل كبير بين الأشخاص وقد تحتوي على أحرف متصلة ومسافات غير منتظمة وأشكال غامضة، ولذلك يمكن أن تكون نتائجها أقل دقة بصورة ملحوظة.
إذا كانت الصفحة المكتوبة بخط اليد مهمة، تعامل مع الناتج كمسودة نسخ وليس كنص نهائي موثوق. راجع النتيجة كاملة مقابل الصورة الأصلية قبل حفظها أو نشرها أو الاعتماد عليها.
هل يحافظ OCR على تخطيط المستند الأصلي؟
هذه الأداة مصممة لاستخراج نص قابل للتحرير، وليست لإعادة إنشاء المستند بتخطيط مطابق للبكسل. الجداول المعقدة والأعمدة المتعددة وترتيب القراءة غير المعتاد والنص المحيط بالرسومات والصفحات ذات التصميم المعقد قد لا يتم تمثيلها تماماً كما تظهر في الصورة.
بالنسبة للفقرات البسيطة ولقطات الشاشة والملصقات والمستندات ذات البنية المباشرة، يكون النص المستخرج مفيداً غالباً دون الكثير من التعديل. أما المستندات المعقدة فقد تحتاج إلى بعض التنسيق اليدوي بعد التعرّف.
متى تكون أداة OCR للصور مفيدة؟
حدود OCR التي يجب معرفتها
النص الناتج عن OCR هو نتيجة تعرّف وليس نسخة مضمونة مطابقة للأصل. تعتمد الدقة على جودة الصورة ونموذج اللغة. يمكن أن تقل الدقة بسبب ضعف التباين والخطوط غير المعتادة وتشوه المنظور والنص العمودي والكتابة اليدوية والخلفيات المعقدة والمستندات متعددة اللغات.
لا تعتمد على نتيجة OCR باعتبارها دقيقة بصورة مطلقة عندما يتعلق النص بمعلومات قانونية أو طبية أو مالية أو أكاديمية أو متعلقة بالسلامة. تحقق من البيانات المهمة مباشرة من الصورة الأصلية.
الأسئلة الشائعة
هل أداة OCR للصور مجانية؟
نعم. يمكنك استخدام مساحة OCR في CyberTools دون إنشاء حساب.
هل تقوم CyberTools برفع صورتي لإجراء OCR؟
تتم معالجة الصورة المحددة ضمن سير عمل OCR في المتصفح. ومع ذلك قد يحتاج المتصفح إلى تنزيل مكتبة OCR وبيانات اللغة.
ما صيغ الصور المدعومة؟
تقبل الأداة الحالية صور PNG وJPG وJPEG وWebP.
ما الحد الأقصى لحجم صورة OCR؟
حدود الأمان الحالية هي 20 ميجابايت لحجم الملف و25 ميجابكسل للصورة بعد فك الترميز.
هل يستطيع OCR التعرّف على العربية؟
نعم. العربية إحدى لغات التعرّف المتاحة في مساحة OCR الحالية.
هل يدعم اليابانية والكورية والهندية؟
نعم. تتوفر اليابانية والكورية والهندية إلى جانب عدة لغات أخرى.
هل يحافظ OCR على الجداول والتنسيق؟
ليس بالضرورة. تركز الأداة على استخراج النص القابل للتحرير ولا تضمن إعادة بناء تخطيط المستند المعقد بصورة مطابقة.
لماذا تعرّف OCR على بعض الأحرف بشكل خاطئ؟
يمكن أن تسبب الضبابية وانخفاض الدقة والخطوط غير المعتادة وضعف التباين والدوران وتشابه الحروف أخطاءً في التعرّف. يساعد اختيار اللغة الصحيحة واستخدام صورة أوضح.
تواصل معنا
هل هناك شيء مفقود؟
يمكنك طلب أداة غير موجودة أو إرسال ملاحظاتك إلينا عبر نموذج التواصل.
تواصل معنا