Orijinal Aciklama
Toolkit for linearizing PDFs for LLM datasets/training
🤖 AI Analizi (Turkce)
Bu GitHub reposu, PDF ve diğer görüntü tabanlı belge formatlarını temiz, okunabilir, düz metin formatına dönüştürmek için kullanılan bir araçtır. OLMoCR (Optical Layout and Mark-up Conversion for Reading), özellikle büyük dil modelleri (LLM) için veri setleri oluşturmak üzere tasarlanmıştır. Araç, PDF, PNG ve JPEG tabanlı belgeleri temiz Markdown formatına dönüştürür ve denklemler, tablolar, el yazısı ve karmaşık formatları destekler.
🎯 Hedef Kitle: Doğal dil işleme (NLP) ve yapay zeka (AI) geliştiricileri, özellikle büyük dil modelleri (LLM) için veri setleri oluşturmak isteyenler
TEMEL OZELLIKLER
- PDF ve görüntü tabanlı belgeleri temiz Markdown formatına dönüştürme
- Denklemler, tablolar, el yazısı ve karmaşık formatları destekleme
- Başlık ve altlıkları otomatik olarak kaldırma
- Doğal okuma sırası ile metin çıkarma
- Etkili ve uygun maliyetli (7B parametreli bir VLM tabanlı, GPU gerektirir)
💡 Kullanım Örneği
Bir NLP mühendisi, büyük dil modelleri için bir veri seti oluşturmak üzere OLMoCR aracını kullanabilir. Örneğin, bir PDF belgesini temiz Markdown formatına dönüştürerek, modelin eğitimi için gerekli olan temiz ve okunabilir metni elde edebilir. Bu, modelin performansını artırır ve veri seti oluşturma sürecini hızlandırır.
📊 Trend Gecmisi
🔗 Benzer Projeler
A curated list of awesome Claude Skills, resources, and tools for customizing Cl…
Open-source AI penetration testing tool to find and fix your app’s vulnerabiliti…
Learn it. Build it. Ship it for others.
World's first open-source, agentic video production system. 12 production pipeli…
Kronos: A Foundation Model for the Language of Financial Markets