Fast Rust library for PDF inspection, classification, and text extraction. Intelligently detects scanned vs text-based PDFs to enable smart routing decisions.
🤖 Türkçe AI Analizi
pdf-inspector, hızlı ve akıllı bir Rust kütüphanesidir, PDF belgelerinin sınıflandırılması, metin çıkarılması ve Markdown'a dönüştürülmesi için tasarlanmıştır. Bu kütüphane, PDF'nin metin tabanlı mı yoksa taranmış mı olduğunu tespit edebilir, metni konum bilgisiyle çıkarabilir ve temiz Markdown'a çevirebilir. Ayrıca, Python, Node.js ve WebAssembly için bağlayıcılar içermektedir.
🎯 Hedef Kitle: PDF işleme ve analizine ihtiyaç duyan Rust geliştiricileri, özellikle belge işleme, metin çıkarma ve Markdown dönüşümü gereksinimleri olanlar
Akıllı sınıflandırma: PDF'nin metin tabanlı, taranmış, görüntü tabanlı veya karışık olduğunu tespit eder Metin çıkarma: Konum bilgisiyle metni çıkarır, yazı tipi bilgisi, X/Y koordinatları ve otomatik çok sütunlu okuma sırası sağlar Markdown dönüşümü: Başlıklar, madde işaretleri, kod blokları, tablolar, kalın/italik biçimlendirme, URL bağlantıları ve sayfa kırıkları oluşturur
💡 Kullanım Örneği
Bir belge tarama şirketinde, pdf-inspector kütüphanesini kullanarak PDF belgelerini hızlıca işleyebilir ve metin tabanlı olanları yerel olarak işleyebilirsiniz. Örneğin, bir fatura işleme sisteminde, pdf-inspector kullanarak faturaların metin içeriğini hızlıca çıkarabilir ve işleyebilirsiniz.