Rehber · OCR hattı
Taranmış evrakta OCR
Dosyaların büyük bölümü taranmış gelir: fotokopi ekler, eski tutanaklar, faks çıktıları. Bu yazı, o sayfaların Lexapel'de nasıl metne döndüğünü — ve nerede döndürülemediğini — hattın kendi kodundan anlatır.
Taranmış evrak neden aranmıyor
Bir PDF iki şekilde oluşabilir: metin katmanıyla (dijital doğmuş) veya yalnızca görüntüyle (taranmış). İkisi de aynı görünür, ama ikincisinde aranabilir tek bir karakter yoktur. Meslektaşın "dosyada arama çalışmıyor" dediği durumun teknik karşılığı budur.
Ürün bu ayrımı sayfa düzeyinde yapar. Bir sayfada anlamlı miktarda gömülü metin yoksa (eşik: 10 karakterin altı) o sayfa "taranmış" sayılır ve tanıma hattına alınır. Belge bu sırada hata durumuna düşmez; işleme sürüyor olarak kalır, OCR bitince kaldığı yerden devam eder.
Seçici OCR: hangi sayfa tanımaya gider
Hattın en pratik özelliği seçiciliğidir. Belgenin tamamı yeniden taranmaz; sayfa sayfa karar verilir:
- Metin katmanı olan sayfa: metni aynen alınır — tanıma çalıştırılmaz, hata payı sıfırdır.
- Metinsiz sayfa: 300 DPI çözünürlükte gri tonlamalı görüntüye çevrilir ve tanıma motoruna verilir.
- Çıktı sayfa sayfa saklanır ve her sayfa hangi yoldan geldiğini (doğal metin mi, tanıma mı) taşır.
Karışık belgeler kuraldır, istisna değil: dijital bir dilekçenin arkasına taranmış ekler iliştirilir. Seçici OCR tam bu durumda kazandırır — 300 sayfalık bir belgenin yalnız 40 taranmış sayfası tanımaya gider.
Hattın künyesi
Aşağıdaki değerler ürünün OCR süreci tarafından fiilen kullanılan değerlerdir.
| Kapsam | Yalnız PDF. DOCX ve UDF zaten metin taşıdığı için OCR yoluna girmez. |
|---|---|
| Tanıma motoru | Tesseract, Türkçe + İngilizce dil paketleriyle (tur+eng) birlikte çalışır. |
| Görüntüye çevirme | 300 DPI, gri tonlama; render açık kaynaklı bir PDF motoruyla yapılır. |
| Taranmış sayfa eşiği | Sayfada 10 karakterden az doğal metin varsa sayfa taranmış sayılır. |
| Çıktı | Sayfa listesi taşıyan bir artifact (ocr.json) nesne deposuna yazılır; her sayfa için metin ve kaynak (native / ocr) bulunur. |
| Devir | Tanıma bittiğinde belge normal işleme işine geri verilir; parçalama, dizinleme ve anlamsal indeks tek yerde kalır. |
| Sıra | OCR işinin kuyruk önceliği devam işine aynen taşınır; ikinci aşamada sıraya yeniden düşülmez. |
| Yalıtım | OCR ayrı bir süreçte çalışır; bellek sınırı olan kendi konteynerindedir ve uygulama sunucusunu etkilemez. |
OCR'lı sayfaya atıf yapılabilir mi
Evet — ve fark burada. Tanıma çıktısı sayfa numarasını koruduğu için OCR'dan geçmiş bir belgedeki bulgu, dijital doğmuş bir belgedeki gibi gerçek sayfa numarasıyla gösterilir. Sayfa sayısı tahmin edilmez, sayılır.
Bu, ürünün temel iddiasının taranmış evrakta da geçerli olmasını sağlayan adımdır: yanıtın altındaki atıf, meslektaşın açıp bakabileceği bir sayfaya işaret eder. Atıfların nasıl denetlendiği dosya düzeni rehberinde ayrıca anlatılıyor.
Kabul edilmiş sınırlar
OCR, pazarlamada en çok abartılan başlıklardan biri. Bu hattın bugün yapamadıkları aşağıda; keşfetmek için ödeme yapmanız gerekmesin.
Bugün yapar
- Basılı Türkçe ve İngilizce metni tanır; iki dil aynı belgede karışık olabilir.
- Metni olan sayfalara dokunmaz — o sayfalarda hata payı yoktur.
- Gerçek sayfa numarasını korur; OCR sonrası tam metin araması ve atıf çalışır.
- Tanıma adımını kendi altyapımızda yapar; belge üçüncü taraf bir OCR servisine gönderilmez.
Bugün yapmaz
- El yazısını okumaz — motor basılı metin için tasarlanmıştır, el yazısı çıktısı güvenilmez.
- Tablo düzenini yeniden kurmaz; tablolar düz metin satırlarına dönüşür, hücre ilişkisi kaybolur.
- Mühür, kaşe, imza ve fotoğrafları tanımaz; bunlar görüntü olarak kalır.
- Belge içindeki gömülü görsellerin (örneğin Word'e yapıştırılmış tarama) yazısını okumaz.
- TIFF eklerini işlemez.
- Ölçülmüş bir doğruluk oranı vaat etmez; sonuç tarama kalitesine bağlıdır.
OCR çıktısı bir onaylı suret veya çeviri değildir. Alıntı yapacağınız her ibareyi belgenin aslından teyit edin; özellikle rakam, tarih ve özel adlarda tanıma hatası mümkündür.
OCR başarısız olursa
Tanıma bir belgede tamamen başarısız olursa iş sessizce kaybolmaz: yeniden denenir ve deneme hakkı bitince belge, "OCR başarısız — belge görüntü kalitesini kontrol edin" açıklamasıyla hatalı olarak işaretlenir. Böylece hangi belgenin neden gelmediği görünür kalır.
Süreç bir bellek sınırına çarpıp ölürse (çok büyük tarama) iş kuyrukta askıda kalmaz: sahipsiz kalan işler belirli bir süre sonra kuyruğa iade edilir. Sonuç gecikmedir, veri kaybı değil.
Sık sorulanlar
El yazısı okunuyor mu?
Hayır. Hattaki tanıma motoru basılı metin için tasarlanmış bir OCR motorudur; el yazısı için ayrı bir model bulunmuyor. El yazısı bir sayfada motor yine de bir çıktı üretir, ancak bu çıktı güvenilmez. El yazısı tutanak, şerh ve imza notlarını çalışılabilir metin sayacak bir vaat vermiyoruz.
Bütün belge yeniden mi taranıyor?
Hayır ve bu bilinçli bir tercih. Sayfa sayfa bakılır: metin katmanı olan sayfanın metni aynen alınır, yalnızca metinsiz sayfalar görüntüye çevrilip tanımaya gönderilir. Karışık belgelerde (dijital dilekçe + taranmış ek) bu, hem süreyi hem hatayı ciddi biçimde düşürür.
OCR'lı sayfaya sayfa numarasıyla atıf yapılabiliyor mu?
Evet. Tanıma çıktısı sayfa sayfa saklanır ve her sayfa gerçek sayfa numarasını taşır; bu yüzden OCR'dan geçmiş bir PDF'teki bulgu, dijital doğan bir PDF gibi sayfa numarasıyla gösterilir. UDF ve DOCX'te durum farklıdır: o formatlarda fiziksel sayfa olmadığı için atıf bölüm olarak verilir.
OCR doğruluk oranınız kaç?
Yayımlanmış bir doğruluk oranımız yok, çünkü kendi belge kümemizde ölçmedik. Ölçmediğimiz bir sayıyı pazarlama metnine koymuyoruz. Pratikte sonuç taramanın kalitesine bağlıdır: düz, dik ve temiz taramalarda çıktı yüksek doğrulukta olur; eğri, soluk veya düşük çözünürlüklü fotokopilerde hata artar.
Belgem OCR için dışarıdaki bir servise gönderiliyor mu?
Hayır. Tanıma adımı bizim kendi konteynerimizde, açık kaynaklı bir motorla çalışır; üçüncü taraf bir OCR servisine belge gönderilmez. Bu, ürünün yapay zekâ adımlarıyla karıştırılmamalıdır — model kullanan özelliklerde verinin nereye gittiği ayrı bir konudur ve KVKK ile açık rıza metinlerinde ayrıntılı olarak yazılıdır.
Word veya UDF belgede OCR çalışır mı?
Hayır, gerekmez de. OCR yalnızca PDF yolunda devreye girer; DOCX ve UDF zaten metin taşıyan formatlardır ve metinleri doğrudan okunur. Taranmış bir ek bir Word belgesinin içine görsel olarak gömülmüşse, o görselin içindeki yazı bugün okunmaz.
Bu sayfa Lexapel'in teknik davranışını anlatır; hukuki tavsiye değildir ve usul/süre bilgisi içermez. Ürünün ürettiği her metni ve her atfı dosyanızın aslıyla teyit etmek meslektaşın kendi sorumluluğundadır.
Taranmış ekleri de aranabilir yapın
Lexapel taranmış sayfaları tanır, gerçek sayfa numarasıyla dizinler ve sorduğunuz soruyu o sayfaya atıf vererek yanıtlar.