Alat Gambar Alat online gratis

OCR Gambar — Ekstrak Teks dari Gambar

Ekstrak teks yang dapat diedit dari gambar PNG, JPG, JPEG, dan WebP langsung di browser Anda.

Gratis digunakan Tanpa daftar Berbasis browser
Alat online

OCR Gambar — Ekstrak Teks dari Gambar

Siap
OCR di browser

Gambar yang dipilih diproses di browser Anda dan tidak diunggah ke CyberTools untuk OCR. Pustaka OCR dapat mengunduh file mesin dan bahasa yang diperlukan untuk pengenalan.

Untuk hasil OCR yang lebih baik

Gunakan gambar yang tajam, lurus, dengan teks jelas dan kontras yang baik. Teks kecil, buram, miring, atau dekoratif dapat mengurangi akurasi.

OCR Gambar Gratis — Ekstrak Teks dari Gambar Online

CyberTools OCR Gambar mengubah teks yang terlihat di dalam gambar menjadi teks yang dapat diedit langsung di browser Anda. Pilih gambar PNG, JPG, JPEG, atau WebP, tentukan bahasa pengenalan, jalankan optical character recognition, lalu salin hasilnya atau unduh sebagai file TXT.

Pemrosesan OCR berjalan di browser menggunakan Tesseract.js. Gambar sumber yang Anda pilih tidak diunggah ke CyberTools untuk proses pengenalan. Namun, browser dapat mengunduh mesin OCR dan data bahasa yang dibutuhkan ketika diperlukan.

Alat ini berguna untuk mengekstrak teks dari tangkapan layar, dokumen hasil pindai, halaman yang difoto, struk, label, formulir, slide presentasi, dan gambar lain yang berisi teks cetak yang dapat dibaca. OCR tidak selalu sempurna, jadi informasi penting sebaiknya selalu dibandingkan dengan gambar asli.

Cara Mengekstrak Teks dari Gambar

  1. 1 Pilih gambar PNG, JPG, JPEG, atau WebP, atau seret gambar ke area OCR.
  2. 2 Periksa pratinjau gambar, nama file, dimensi, dan ukuran file sebelum memprosesnya.
  3. 3 Pilih bahasa yang paling sesuai dengan teks yang terlihat pada gambar.
  4. 4 Klik Ekstrak Teks dan tunggu sementara mesin OCR menganalisis gambar di browser Anda.
  5. 5 Periksa teks hasil pengenalan, perbaiki kesalahan OCR bila ada, lalu salin atau unduh file TXT.

Apa Itu OCR Gambar?

OCR adalah singkatan dari optical character recognition. Perangkat lunak OCR menganalisis bentuk dan pola dalam gambar lalu mencoba mengenalinya sebagai huruf, angka, tanda baca, dan kata. Hasilnya adalah teks yang dapat dibaca mesin, dipilih, diedit, dicari, dan digunakan kembali.

OCR tidak sekadar menyalin lapisan teks tersembunyi dari gambar biasa. File PNG dan JPEG umumnya berisi piksel, bukan kata yang dapat diedit. Mesin pengenalan harus menafsirkan piksel tersebut dan memperkirakan karakter yang diwakilinya. Karena itu kualitas gambar, bahasa, font, orientasi, kontras, dan tata letak memengaruhi akurasi.

Bahasa Pengenalan OCR

CyberTools saat ini menyediakan pilihan pengenalan untuk bahasa Inggris, Arab, Jerman, Spanyol, Prancis, Hindi, Indonesia, Jepang, Korea, Portugis, dan Turki. Bahasa pengenalan menentukan model bahasa yang digunakan mesin OCR dan terpisah dari bahasa antarmuka CyberTools.

Pilih bahasa yang benar-benar digunakan dalam gambar. Misalnya, menggunakan antarmuka CyberTools dalam bahasa Indonesia tidak berarti tangkapan layar berbahasa Inggris harus diproses dengan model bahasa Indonesia. Pilih bahasa Inggris untuk teks Inggris, Arab untuk teks Arab, Jepang untuk teks Jepang, dan seterusnya.

Data bahasa dapat berukuran cukup besar. Karena itu proses OCR pertama dengan bahasa tertentu mungkin membutuhkan waktu lebih lama sementara browser menyiapkan mesin dan mengambil data pengenalan yang diperlukan.

OCR

Cara Meningkatkan Akurasi OCR

OCR biasanya bekerja paling baik ketika karakter mudah dibedakan. Untuk hasil yang lebih baik:

  1. 1 Gunakan gambar yang tajam sehingga setiap huruf terlihat jelas.
  2. 2 Jaga teks tetap lurus sebisa mungkin dan hindari rotasi atau kemiringan yang berlebihan.
  3. 3 Gunakan gambar dengan kontras yang jelas antara teks dan latar belakang.
  4. 4 Hindari blur berat, pantulan, bayangan, artefak kompresi, dan teks yang sangat kecil.
  5. 5 Potong bagian visual yang tidak diperlukan jika mengganggu area teks.
  6. 6 Pilih bahasa pengenalan yang benar untuk teks yang ingin diekstrak.
  7. 7 Bandingkan nama, tanggal, nilai uang, dan nomor referensi penting dengan gambar asli setelah OCR.

OCR dapat keliru membedakan karakter yang bentuknya mirip. Contohnya adalah angka 0 dan huruf O, angka 1 dan huruf kecil l, atau tanda baca tertentu. Resolusi rendah dan font dekoratif meningkatkan kemungkinan kesalahan tersebut.

Format Gambar yang Didukung dan Batas Keamanan Browser

Area kerja OCR CyberTools saat ini menerima gambar PNG, JPG, JPEG, dan WebP. Batas keamanan di browser adalah 20 MB per file yang dipilih dan 25 megapiksel setelah gambar didekode.

Ukuran file dan ukuran gambar setelah didekode adalah dua hal berbeda. JPEG terkompresi mungkin hanya beberapa megabita di penyimpanan tetapi dapat membutuhkan jauh lebih banyak memori setelah didekode. Mesin OCR juga membutuhkan memori tambahan untuk proses pengenalan, sehingga gambar yang sangat besar dapat membebani ponsel dan perangkat dengan memori terbatas.

Format input PNG, JPG, JPEG, WebP
Ukuran file maksimum 20 MB
Ukuran maksimum setelah didekode 25 megapiksel
Pemrosesan OCR di browser
Output Teks yang dapat diedit dan unduhan TXT
Perlu akun Tidak

Privasi dan Pemrosesan di Browser

Gambar sumber yang dipilih diproses secara lokal di browser untuk OCR dan tidak dikirim ke endpoint konversi CyberTools. Hal ini berguna bila Anda tidak ingin mengirim gambar sumber ke server pemrosesan situs.

Pemrosesan di browser tidak berarti tidak ada aktivitas jaringan sama sekali. Pustaka Tesseract OCR dan file bahasa terlatih dapat diunduh ketika diperlukan. Perbedaan utamanya adalah gambar yang Anda pilih diproses dalam alur OCR sisi browser.

Untuk dokumen yang sangat sensitif, tetap pertimbangkan keamanan perangkat, browser, ekstensi yang terpasang, lingkungan jaringan, dan persyaratan keamanan organisasi Anda.

Teks Cetak dibanding Tulisan Tangan

Sistem OCR umum paling andal pada teks cetak atau teks digital yang jelas. Tulisan tangan sangat bervariasi antarorang dan dapat memiliki karakter yang tersambung, jarak tidak teratur, serta bentuk ambigu, sehingga hasilnya bisa jauh kurang akurat.

Jika halaman tulisan tangan penting, perlakukan hasil OCR sebagai draf transkripsi, bukan salinan yang dianggap pasti. Periksa seluruh hasil terhadap gambar asli sebelum menyimpan, menerbitkan, atau mengandalkannya.

Apakah OCR Mempertahankan Tata Letak Asli?

Alat ini dirancang untuk mengekstrak teks yang dapat diedit, bukan membangun ulang dokumen lengkap dengan tata letak yang sama persis per piksel. Tabel kompleks, banyak kolom, urutan baca yang tidak biasa, teks di sekitar grafik, dan halaman dengan desain rumit mungkin tidak direproduksi seperti aslinya.

Untuk paragraf sederhana, tangkapan layar, label, dan dokumen dengan struktur jelas, teks hasil ekstraksi sering dapat langsung digunakan. Dokumen yang lebih kompleks mungkin memerlukan penyuntingan manual setelah pengenalan.

Kapan OCR Gambar Berguna?

Mengubah teks pada tangkapan layar menjadi teks yang dapat diedit.
Mengekstrak paragraf dari halaman yang difoto atau dipindai.
Menyalin kode produk, label, atau nomor mirip nomor seri dari gambar.
Mengambil teks dari slide presentasi atau grafik.
Membuat draf transkripsi struk, catatan, atau formulir.
Membuat teks di dalam gambar lebih mudah dicari dan digunakan kembali.
Memindahkan teks yang terlihat ke dokumen tanpa mengetik ulang setiap baris.

Batasan OCR yang Perlu Diketahui

Hasil OCR adalah interpretasi otomatis, bukan transkripsi yang dijamin tepat. Akurasi bergantung pada gambar sumber dan model pengenalan. Kontras rendah, font tidak biasa, distorsi perspektif, teks vertikal, tulisan tangan, latar belakang rumit, dan dokumen multibahasa dapat menurunkan keandalan.

Jangan menganggap hasil OCR pasti benar jika teks memiliki konsekuensi hukum, medis, keuangan, akademis, atau keselamatan. Verifikasi informasi penting langsung dari gambar asli.

Pertanyaan yang Sering Diajukan

Apakah alat OCR Gambar ini gratis?

Ya. Anda dapat menggunakan area kerja OCR CyberTools tanpa membuat akun.

Apakah CyberTools mengunggah gambar saya untuk OCR?

Gambar yang dipilih diproses di browser dalam alur OCR saat ini. Pustaka OCR dan data bahasa masih dapat memerlukan unduhan jaringan.

Format gambar apa yang didukung?

Alat ini saat ini menerima PNG, JPG, JPEG, dan WebP.

Berapa ukuran maksimum gambar OCR?

Batas keamanan saat ini adalah 20 MB untuk file yang dipilih dan 25 megapiksel untuk gambar setelah didekode.

Apakah OCR dapat mengenali teks Arab?

Ya. Bahasa Arab adalah salah satu bahasa pengenalan yang tersedia saat ini.

Apakah bahasa Jepang, Korea, dan Hindi didukung?

Ya. Jepang, Korea, dan Hindi tersedia bersama beberapa bahasa lainnya.

Apakah tabel dan pemformatan tetap dipertahankan?

Tidak selalu. Alat ini berfokus pada ekstraksi teks yang dapat diedit dan tidak menjanjikan rekonstruksi tata letak kompleks secara persis.

Mengapa beberapa karakter dikenali secara salah?

Blur, resolusi rendah, font tidak biasa, kontras lemah, rotasi, dan karakter yang bentuknya mirip dapat menyebabkan kesalahan. Gambar yang lebih jelas dan bahasa yang tepat biasanya membantu.