PDFMove
Kitap Taramasında Çift Sayfa Sorunu: Neden Oluşur, Ne Yapılır?
Rehber

Kitap Taramasında Çift Sayfa Sorunu: Neden Oluşur, Ne Yapılır?

5 dk okuma

Taranmış bir kitap PDF'ini açtığınızda her yaprakta iki sayfa görüyorsanız, bu bir hata değil — tarayıcının gördüğünü olduğu gibi kaydetmesinin doğal sonucu. Bu yazıda bu durumun neden oluştuğunu, PDF'in sayfa boyutlarını nasıl tanımladığını ve bölme işleminin dosyanın içinde tam olarak neyi değiştirdiğini anlatıyoruz.

Tarayıcı ne görüyorsa onu kaydeder

Düz yataklı bir tarayıcıda kitabı açıp cama koyduğunuzda, tarama kafası cam yüzeyin tamamını tek bir geçişte okur. Kitap iki sayfa halinde açık durduğu için o iki sayfa tek bir görüntü olur. Tarayıcı yazılımı "burada iki mantıksal sayfa var" diye bir çıkarım yapmaz; önündeki dikdörtgen alanı piksel piksel kaydeder.

Bu görüntü PDF'e yerleştirildiğinde ortaya şu yapı çıkar:

  • Sayfa sayısı = tarama sayısı = fiziksel kitap sayfalarının yarısı.
  • Sayfa boyutu = tarama alanının boyutu, genellikle A4 yatay veya daha geniş.
  • İçerik = tek bir büyük görsel nesnesi, sayfaya tam oturacak şekilde yerleştirilmiş.

Aynı sonuç fotokopi makinelerinde, kitap tarayan telefon uygulamalarında ve eski dergi arşivlerinde de görülür. Bazı dijital arşivler ise bunu kasten yapar: sayfa çevirme deneyimini taklit etmek için iki sayfayı yan yana sunar.

PDF sayfa boyutunu nasıl tanımlar

Bölme işleminin ne yaptığını anlamak için PDF'in sayfa geometrisini bilmek gerekiyor. Her sayfa nesnesinde birkaç dikdörtgen tanımı bulunur:

| Kutu | Anlamı | |---|---| | MediaBox | Sayfanın fiziksel ortam boyutu — basılacağı kağıdın ölçüsü | | CropBox | Görüntüleyicinin ekranda göstereceği alan | | BleedBox | Baskıda taşma payı sınırı | | TrimBox | Kesim sonrası nihai sayfa boyutu | | ArtBox | Anlamlı içerik alanı |

Günlük kullanımda ilk ikisi önemlidir. MediaBox her sayfada zorunludur ve sayfanın tam boyutunu verir. CropBox isteğe bağlıdır; tanımlıysa görüntüleyici sayfayı o dikdörtgene kırpılmış gibi gösterir, tanımlı değilse MediaBox'ı kullanır.

Kritik nokta: CropBox içeriği silmez. Kutunun dışında kalan görsel veriler dosyada durmaya devam eder, sadece görünmez. Bir PDF'i kırpıp gizli bilgiyi sakladığınızı sanmak bu yüzden tehlikeli bir hatadır — kırpma kutusunu genişleten herkes gizlenen içeriği geri görür.

Bölme işlemi içeride ne yapıyor

Bir yaprağı ikiye bölmenin iki farklı uygulama yöntemi var ve hangisinin kullanıldığı sonucu etkiler.

Yöntem 1: Kırpma kutusuyla bölme. Araç, aynı sayfa içeriğini iki kez referans alan iki yeni sayfa nesnesi oluşturur. Birinci sayfanın CropBox'ı orijinal alanın sol yarısına, ikincisininki sağ yarısına ayarlanır. Görsel veri hiç dokunulmaz.

  • Avantajı: son derece hızlı, kalite kaybı kesinlikle sıfır.
  • Dezavantajı: dosya boyutu küçülmez, hatta biraz büyür. Her iki sayfa da tam görüntüye referans verdiği için görsel veri bir kez saklanır ama iki kez kullanılır.

Yöntem 2: Görüntüyü fiziksel olarak kesme. Araç, sayfadaki görseli çözer, ortadan ikiye keser, iki yeni görsel üretir ve her birini kendi sayfasına yerleştirir.

  • Avantajı: her sayfa sadece kendi verisini taşır, gizli içerik kalmaz.
  • Dezavantajı: görselin yeniden kodlanması gerekebilir. Kaynak JPEG ise ve JPEG olarak yeniden kaydedilirse ikinci bir kayıplı kodlama eklenir.

Uygulamada çoğu araç birinci yöntemi kullanır çünkü hızlı ve kayıpsızdır. Dosya boyutunu küçültmek istiyorsanız bölme sonrası sıkıştırma aracından geçirmek daha iyi bir stratejidir.

Neden merkez her zaman doğru olmuyor

Bölme aracı sayfayı geometrik olarak tam ortasından böler: CropBox genişliğini ikiye böler ve kesme çizgisini oraya koyar. İçeriğin nerede olduğuna, kitap sırtının hangi pikselde göründüğüne bakmaz.

Bu, tarama simetrikse mükemmel çalışır. Gerçek hayatta ise şunlar olur:

  • Kitap cama tam ortalanmadan konur; sırt gerçek merkezden birkaç santim kayar.
  • Kalın ciltli kitaplarda sayfalar cama tam yaslanmaz ve sol-sağ genişlikleri eşit çıkmaz.
  • Tarama alanı kitaptan genişse bir kenarda beyaz bant kalır ve merkez kayar.
  • Sayfa hafifçe eğik durur; sırt çizgisi dikey değil, hafif açılıdır.

Çözüm, bölmeden önce kırpma yapmaktır: fazla kenarları atıp sırtı gerçek merkeze getirin, sonra bölün. Eğik taramalar için ise yazılımsal çözüm sınırlıdır; belirgin eğiklik varsa taramayı tekrarlamak en temiz yoldur.

Okuma yönü meselesi

Bölme aracı, bölünmüş sayfaları soldan sağa sıralar: yaprak 1'in sol yarımı yeni sayfa 1, sağ yarımı yeni sayfa 2 olur. Latin alfabesi kullanan diller için doğrudur.

Sağdan sola okunan belgelerde — Osmanlıca arşiv belgeleri, Arapça ve Farsça kitaplar, Japonca manga — sağ yarım önce gelmelidir. Araç bunu içerikten anlayamaz; dolayısıyla bölme sonrası sayfa organize aracıyla sırayı düzeltmeniz gerekir. Alternatif olarak bazı e-okuyucular sağdan sola okuma modunu destekler ve dosyayı düzeltmeden okumanızı sağlar.

Sırt gölgesi neden kalıyor

Kitabın iki sayfası birleştiği yerde kağıt cama tam değmez ve orada bir karanlık şerit oluşur. Bu, taramada gerçek piksel verisidir — bölme işlemi onu kaldırmaz, sadece ikiye böler. Sonuçta sol sayfanın sağ kenarında, sağ sayfanın sol kenarında bir gölge şeridi kalır.

Temizlemek için bölme sonrası kırpma gerekir, ama bir asimetri sorunu vardır: gölge tek sayfalarda bir kenarda, çift sayfalarda diğer kenardadır. Kırpma tüm sayfalara aynı uygulandığı için tam temizlik ancak tek ve çift sayfaları ayrı işleyip birleştirerek yapılabilir. Çoğu belgede buna değmez; birkaç milimetrelik simetrik bir kırpma gölgenin büyük kısmını alır.

OCR ile ilişkisi

Taranmış bir belgede metin araması yapmak istiyorsanız OCR uygulamanız gerekir. Sıralama önemlidir: önce bölün, sonra OCR yapın.

Sebebi şu: OCR motorları sayfadaki metin bloklarını tespit edip okuma sırasına dizer. Çift sayfalı bir yaprakta iki sütun blok vardır ve motor bunları bazen tek bir iki sütunlu düzen sanır, bazen de satırları yatay olarak soldan sağa okuyup iki sayfanın metnini iç içe geçirir. Çıkan metin "Bir zamanlar bir ülkede yaşayan kral, ertesi gün toplantıya" gibi anlamsız bir karışım olur.

Bölünmüş tek sayfalarda böyle bir belirsizlik olmaz; her sayfa kendi başına normal bir sayfadır.

Özetle

Çift sayfa sorunu, tarayıcının gördüğü alanı tek bir görüntü olarak kaydetmesinden doğar. PDF'te sayfa boyutu MediaBox ve CropBox dikdörtgenleriyle tanımlanır ve bölme işlemi genellikle bu kutuları oynayarak çalışır — bu yüzden hızlıdır ve kalite kaybı yaratmaz, ama dosyayı küçültmez. Bölme geometrik merkezi kullandığı için asimetrik taramalarda önce kırpma gerekir; sırt gölgesi bölmeyle kalkmaz; sağdan sola okunan belgelerde sıra elle düzeltilmelidir. Ve OCR planlıyorsanız bölme işlemi mutlaka OCR'dan önce gelmelidir.

Sıkça Sorulan Sorular

Bölme işlemi görüntüyü gerçekten kesiyor mu, yoksa sadece gizliyor mu?

Uygulamaya göre değişir. En hafif yöntem, aynı görüntüyü iki kez referans alıp her sayfanın kırpma kutusunu farklı yarıma ayarlamaktır — bu durumda görsel verinin tamamı dosyada kalır, sadece görünmez. Daha kapsamlı yöntem görüntüyü fiziksel olarak ikiye kesip iki ayrı görsel üretmektir. İlki hızlıdır ve kalite kaybı yaratmaz ama dosya küçülmez; ikincisi dosyayı küçültür ama yeniden kodlama gerektirebilir.

MediaBox ve CropBox nedir, hangisi sayfanın boyutunu belirler?

MediaBox sayfanın fiziksel ortam boyutudur — basılacağı kağıdın ölçüsü gibi düşünün. CropBox ise görüntüleyicinin ekranda göstereceği alandır ve MediaBox'ın içinde bir dikdörtgen olarak tanımlanır. CropBox tanımlıysa görüntüleyici onu kullanır; tanımlı değilse MediaBox'a düşer. Bölme ve kırpma işlemleri genellikle CropBox üzerinde çalışır.

Neden bazı taramalarda kesme çizgisi ortada değil?

Çünkü tarama sırasında kitap cama tam ortalanmış biçimde konmamıştır veya kitabın sol ve sağ sayfaları farklı genişlikte taranmıştır. Araç sayfayı geometrik olarak tam ortasından böler; içeriğin nerede olduğuna bakmaz. Belirgin bir kayma varsa bölmeden önce kırpma aracıyla fazla kenarı atıp sırtı merkeze getirmek gerekir.

OCR uygulamadan önce mi bölmeliyim, sonra mı?

Önce bölün. OCR motorları sayfadaki metin bloklarını konumlarına göre sıralar ve çift sayfalı bir yaprakta iki sayfanın satırlarını yatay olarak birbirine karıştırabilir. Bölünmüş tek sayfalarda blok sıralaması çok daha güvenilir olur ve çıkan metin okunabilir bir sırada gelir.

Bu konuyu Sayfa İkiye Böl aracıyla hemen deneyin.

Sayfa İkiye Böl aracını dene