Türkçe Çok Modlu RAG Sistemleri için Parçalama Stratejilerinin Karşılaştırmalı Analizi
Dosyalar
Tarih
Dergi Başlığı
Dergi ISSN
Cilt Başlığı
Yayıncı
Erişim Hakkı
Özet
Geleneksel İçerik Erişimine Dayalı Üretim (RAG) sistemleri; tablo, grafik ve düzensiz yerleşimler içeren karmaşık belgelerle çalışırken bilgi bütünlüğünü korumada genellikle yetersiz kalmaktadır. Bu yapısal sorunların üstesinden gelmek amacıyla bu çalışma, dört farklı parçalama stratejisinin karşılaştırmalı bir analizini sunmaktadır: Basit (Naive), Dinamik, Görsel ve Hibrit RAG. Hibrit mimari; tablo hiyerarşisini koruyan yapıya duyarlı akıllı metin işleme ile hedef odaklı görsel vektör üretimini entegre eden çok aşamalı bir iş akışına dayanmaktadır. Bu stratejilerin performansı; 46 kurumsal entegre rapordan ve 1.380 soru-cevap çiftinden oluşan bir veri seti üzerinde, "LLM-as-a-Judge" yaklaşımı kullanılarak Bağlam Kapsama (Context Recall), Hassasiyet (Precision) ve Doğruluk (Accuracy) metrikleri üzerinden değerlendirilmiştir. Sonuçlar, Hibrit RAG’ın tek modlu sistemlerin sınırlamalarını etkili bir şekilde aştığını göstermektedir. En iyi tek modlu temel yönteme kıyasla Bağlam Kapsama’da 0,82’ye, Hassasiyet’te 0,82’ye ve Cevap Doğruluğu’nda 0,71’e ulaşılmıştır.
Traditional Retrieval Augmented Generation (RAG) systems are often insufficient in preserving information integrity when dealing with complex documents that contain tables, graphs, and irregular layouts. To overcome these structural problems, this study provides a comparative analysis of four different chunking strategies: Naive, Dynamic, Vision, and Hybrid RAG. The Hybrid architecture is based on a multi-stage workflow integrating structure - aware intelligent text processing-which preserves the table hierarchy - with targeted visual vector generation. The performance of these strategies was evaluated on a dataset comprising 46 corporate integrated reports and 1,380 question-answer pairs, using an LLM-as-a-Judge approach across Context Recall, Precision, and Accuracy metrics. The results demonstrate that Hybrid RAG effectively overcomes the limitations of unimodal systems. Compared to the best unimodal baseline, it achieved 0.82 Context Recall, 0.82 Precision, and 0.71 Answer Accuracy.










