Blog
Kaynaklı AI

Türkçe RAG Nedir? Kaynaklı Yapay Zeka ve Güvenilir Cevap Rehberi

Türkçe belgelerde chunking, embedding, hibrit arama, reranking, kaynak sadakati ve çapraz belge kontrolü için teknik RAG rehberi.

DEHA Araştırma7 Ağustos 20269 dk okuma

Türkçe RAG, bir dil modelinin yanıt vermeden önce ilgili belge parçalarını bulup bağlama eklemesini sağlayan retrieval-augmented generation yaklaşımıdır. Amaç modele her şeyi ezberletmek değil, soruyu doğru kanıtla buluşturmaktır. Doğru kurulduğunda kaynak gösterme ve güncel belgeyle çalışma kolaylaşır; yanlış kurulduğunda ise sistem akıcı biçimde yanlış paragrafı özetler.

Kaynaklı Türkçe yapay zeka deneyiminde güven, modelin kendinden emin tonundan değil; hangi belgeden, hangi parçaya dayanarak cevap verdiğinin görülebilmesinden doğar.

RAG kısa tanımı

Dosyayı çıkar → anlamlı parçalara böl → embedding üret → soruya yakın parçaları getir → gerekirse yeniden sırala → modeli yalnız bu kanıtlarla yanıtlat → iddia ile kaynağı eşleştir.

1 RAG hangi sorunu çözer?

Dil modelinin eğitim tarihi geçmiş olabilir, özel şirket belgesini hiç görmemiştir veya bir ayrıntıyı yanlış hatırlayabilir. RAG, modele sorgu anında seçili kaynakları getirerek bu açığı azaltır. Lewis ve arkadaşlarının 2020 tarihli çalışması, parametrik model belleğiyle harici belge indeksini birlikte kullanma yaklaşımını sistematik hale getiren temel çalışmalardan biridir.

RAG halüsinasyonu otomatik olarak sıfırlamaz. Yanlış parça getirilebilir, tablo metne bozuk çevrilebilir veya model kaynakta olmayan bir bağlantı kurabilir. Bu yüzden retrieval başarısı ve cevap sadakati ayrı test edilmelidir.

2 Türkçe belgede metin çıkarma

Pipeline'ın ilk riski embedding değil, metin çıkarma aşamasıdır. Taranmış PDF için OCR; tablo için hücre yapısı; dipnot, başlık ve sayfa numarası için konum bilgisi gerekir. “İmalatçının sorumlulukları” başlığı gövdeyle birleşmezse en iyi embedding modeli bile eksik kanıt döndürebilir.

Kaynak kaydı en az belge kimliği, sayfa, bölüm başlığı, metin ve erişim tarihini korumalıdır. Web sayfasında menü, çerez metni ve script çıktısı temizlenmeli; ancak içerik kaybı yaşanmadığı doğrulanmalıdır. SEC gibi yoğun XBRL içeren sayfalarda ham HTML metnini indekslemek yerine esas rapor bölümlerini yapılandırılmış biçimde çıkarmak gerekir.

3 Chunk boyutu: ne çok küçük ne tek parça

Çok küçük parçalar cümlenin öznesini, istisnasını veya tablo başlığını kaybeder. Çok büyük parçalar ise ilgisiz metni bağlama doldurur ve retrieval hassasiyetini düşürür. Sabit karakter sayısı yerine başlık, paragraf, madde ve tablo sınırlarını kullanan yapısal parçalama çoğu kurumsal belgede daha iyi başlangıçtır.

Chunk overlap her sorunu çözmez; aynı cümleyi birçok kez indeksleyerek sonuçları tek bölgenin işgal etmesine yol açabilir. Hedef, cevabı kanıtlayacak bağlamı tek veya birkaç anlamlı parçada tutmaktır. Kısa belgeler doğrudan bağlama verilebilir, uzun belgeler ise retrieval ve gerektiğinde bölüm bazlı özetleme gerektirir.

4 Türkçe embedding ve arama

Türkçede kök ve ek kombinasyonları, aynı kavramın yüzeyde farklı görünmesine neden olur. Yalnız anahtar kelime araması “üreticinin yükümlülükleri” ile “imalatçı sorumludur” ifadelerini kaçırabilir. Dense embedding anlamsal yakınlığı yakalarken BM25 gibi sözcüksel arama madde numarası, ürün kodu ve özel isimlerde güçlüdür. Hibrit arama iki sinyali birleştirir.

TR-MTEB, Türkçe cümle temsillerini 26 veri seti ve altı görev grubunda değerlendirmek için ortak bir zemin sunuyor. TurkColBERT çalışması da Türkçe bilgi erişiminde late-interaction modellerini yoğun vektör taban çizgileriyle karşılaştırıyor. Yine de genel leaderboard, kurumunuzun sözleşme veya teknik raporlarında aynı sıralamayı garanti etmez.

5 Reranking ve sorgu dönüştürme

İlk arama hızlıca aday parçaları getirir; reranker sorgu-parça çiftini daha pahalı ama daha hassas biçimde yeniden sıralar. Kullanıcının konuşma dilindeki “bu yıl borç ne olmuş?” sorusu, seçili şirket ve rapor yılıyla “2025 toplam borç, kısa ve uzun vadeli yükümlülükler” gibi kontrollü bir arama sorgusuna genişletilebilir.

Sorgu genişletme yeni gerçek uydurmamalıdır. Workspace, seçili kaynak ve konuşma bağlamı açıkça ayrılmalı; başka projedeki şirket adı veya müşteri verisi aramaya sızmamalıdır. Çok kiracılı sistemde indeks filtresi kullanıcı ve workspace seviyesinde backend tarafından uygulanmalıdır.

6 Kaynak sadakati nasıl sağlanır?

Prompt “yalnız kaynakları kullan” demeli, fakat tek savunma prompt olmamalıdır. Nihai cevaptaki her ana iddia kaynak etiketiyle bağlanmalı; alıntının gerçekten o iddiayı destekleyip desteklemediği kontrol edilmelidir. Kaynaklar çelişiyorsa sistem tek bir sonuç üretmek yerine çelişkiyi tarih ve belge bazında göstermelidir.

Yanıt üretilemezse en ilgili parçaları kullanıcıya dökmek faydalı bir teşhis olabilir, fakat bu nihai cevap değildir. “Model yanıtı üretilemedi” durumları ayrıca izlenmeli; model erişimi, prompt uzunluğu, kaynak kalitesi ve retrieval hatası birbirinden ayrılmalıdır.

7 Çapraz belge karşılaştırması

“2024 ve 2025 raporlarında gelir, borç ve risk faktörleri nasıl değişti?” sorusu tek parça retrieval değildir. Her dönem için aynı finansal kavramları bulmak, birim ve dönemleri eşitlemek, ardından değişimi hesaplamak gerekir. XBRL etiketleri bağlamdan kopuk biçimde modele verilirse insan tarafından okunabilir rapor yerine taksonomi gürültüsü oluşur.

Sağlam pipeline önce her belge için yapılandırılmış kanıt tablosu çıkarır, sonra satırları karşılaştırır. Model yorumunu bu tablonun üzerine kurar ve sayıların sayfa/bölüm kaynağını korur. Kullanıcı isterse yorumu değil, yalnız kanıt tablosunu da indirebilmelidir.

8 RAG değerlendirme kontrol listesi

  • Doğru parça ilk k sonuç içinde mi?
  • Sayfa, bölüm ve belge kimliği korunuyor mu?
  • Yanıtın her iddiası gerçekten gösterilen kaynakla destekleniyor mu?
  • Kaynakta olmayan soruda sistem bunu açıkça söyleyebiliyor mu?
  • Çelişkili belgeler ayrı sunuluyor mu?
  • Workspace ve kullanıcı sahiplik filtresi retrieval'dan önce uygulanıyor mu?
  • OCR, tablo ve web crawl hataları gözlemlenebilir mi?

Kaynaklı çalışma akışını denemek için Source Studio içinde ayrı kaynak sohbetleri oluşturabilir; PDF, belge ve web kaynaklarını aynı çalışma alanında sorgulayabilirsiniz.

Türkçe yapay zeka konu kümesi

Retrieval kalitesinin neden tokenizer ve Türkçe veri kalitesiyle birlikte değerlendirilmesi gerektiğini temel yazımızda okuyun. Bu çerçevenin tokenizer, veri, uyarlama ve değerlendirme boyutları için Türkçe yapay zeka ve dil modeli geliştirme yazısına bakabilirsiniz.

Kaynakça

  1. Lewis, P. ve ark. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks.
  2. Karpukhin, V. ve ark. (2020). Dense Passage Retrieval for Open-Domain Question Answering.
  3. Khattab, O. ve Zaharia, M. (2020). ColBERT.
  4. TR-MTEB: Turkish Massive Text Embedding Benchmark.
  5. TurkColBERT: Turkish Information Retrieval, 2025.

Türkçe öncelikli yapay zeka çalışma alanını deneyin

Belge analizi, web ve akademik arama, makale, sunum ve kaynaklı sohbet özelliklerini tek çalışma alanında kullanın.

DEHA'yı Ücretsiz Dene →