Fast Rust library for PDF inspection, classification, and text extraction. Intelligently detects scanned vs text-based PDFs to enable smart routing decisions.
🤖 Türkçe AI Analizi
pdf-inspector, hızlı ve akıllı bir Rust kütüphanesidir, PDF belgelerinin sınıflandırılması, metin çıkarılması ve Markdown'a dönüştürülmesi için tasarlanmıştır. Bu kütüphane, PDF'nin metin tabanlı mı yoksa taranmış mı olduğunu tespit edebilir, metni konum bilgisiyle çıkarabilir ve temiz Markdown'a dönüştürebilir, tüm bunları OCR (Optik Karakter Tanıma) olmadan gerçekleştirir. pdf-inspector, Firecrawl tarafından geliştirilmiştir ve yerel olarak 200ms'den daha kısa sürede metin tabanlı PDF'leri işleyebilir, böylece yaklaşık %54'ü OCR hizmetlerine ihtiyaç duymayan PDF'ler için maliyetli OCR hizmetlerinden kaçınmayı sağlar.
🎯 Hedef Kitle: PDF işleme ve analizine ihtiyaç duyan Rust geliştiricileri, özellikle belge işleme, metin çıkarma ve Markdown dönüşümü gereksinimleri olanlar
Akıllı sınıflandırma: PDF'nin metin tabanlı, taranmış, görüntü tabanlı veya karışık olduğunu ~10-50ms içinde tespit eder Metin çıkarma: Konum bilgisiyle metin çıkarır, yazı tipi bilgisi, X/Y koordinatları ve otomatik çok sütunlu okuma sırası sağlar Markdown dönüşümü: Başlıklar, madde işaretleri, numaralı listeler, kod blokları, tablolar, kalın/italik biçimlendirme, URL bağlantıları ve sayfa kırıkları gibi özellikleri destekler
💡 Kullanım Örneği
Bir belge tarayıcısı veya işleyici yazılım geliştiren bir yazılımcı, pdf-inspector'ı kullanarak PDF belgelerini hızlı ve doğru bir şekilde işleyebilir. Örneğin, bir fatura işleme sisteminde, pdf-inspector kullanarak faturaların metin tabanlı mı yoksa taranmış mı olduğunu tespit edebilir ve metni çıkararak veritabanına kaydedebilir.