Blog
Değerlendirme

Türkçe Yapay Zeka Modelleri Nasıl Değerlendirilir?

TR-MMLU, Cetvel, TurkBench, TurBLiMP, retrieval, kaynak sadakati, insan değerlendirmesi ve production metrikleriyle uygulamalı eval rehberi.

DEHA Araştırma7 Ağustos 20268 dk okuma

Bir modelin Türkçe selamlaşmaya akıcı cevap vermesi, onun Türkçe yapay zeka görevlerinde iyi olduğu anlamına gelmez. Model; ekleri doğru kullanırken kaynak uydurabilir, sınav sorularında başarılıyken uzun PDF'de ilgili paragrafı bulamayabilir veya gündelik Türkçeyi anlayıp katı çıktı formatını izleyemeyebilir. Sağlam değerlendirme bu yetenekleri tek puanda eritmek yerine ayrı ayrı ölçer.

Bu rehber, bir Türkçe yapay zeka asistanını model seçimi, ürün testi veya kurum içi satın alma öncesinde nasıl değerlendirebileceğinizi anlatıyor. Amaç “en iyi model” ilan etmek değil, sizin işiniz için hangi sistemin yeterli olduğunu kanıtlamaktır.

Tek benchmark neden yetmez?

Bilgi sorusu, dilbilgisi, talimat takibi, uzun bağlam, retrieval, güvenlik ve maliyet farklı yeteneklerdir. Bir model TR-MMLU'da yüksek puan alıp kaynak sadakatinde düşük kalabilir. Ürün kararı, görev ağırlıklı bir değerlendirme matrisiyle verilmelidir.

1 Önce kullanım senaryosunu tanımlayın

Değerlendirme veri seti gerçek kullanıcı işlerini temsil etmiyorsa sonuç yanıltıcıdır. Bir hukuk ekibi için mevzuat maddesi bulma ve alıntı doğruluğu; e-ticaret için ürün eşleştirme, fiyat güncelliği ve tablo formatı; eğitim ürünü için açıklamanın yaş düzeyine uygunluğu önceliklidir. Her ekip önce 20-100 gerçek görevi anonim hale getirerek küçük bir “altın set” oluşturmalıdır.

Her örnekte giriş, beklenen davranış, kabul kriteri ve kritik hata tanımlanmalıdır. “İyi cevap” gibi öznel etiket yerine “üç kaynaktan ikisini doğru bağladı”, “JSON şemasını bozmadı” veya “belgede olmayan rakam eklemedi” gibi ölçülebilir kriterler kullanın.

2 Türkçe dil yeterliliğini ayrı ölçün

TurBLiMP, Türkçedeki 16 dil olgusunu minimal çiftlerle sınayarak sözcük sırası esnekliği ve biçimbilimsel süreçler gibi alanlarda modellerin insanlardan farklı duyarlılıklar gösterebildiğini ortaya koyuyor. Bu tür bir test, yalnız yazım denetimi değildir; modelin ek, uyum, yan cümle ve söz dizimi ilişkilerini ayırt edip etmediğini ölçer.

Ürün eval setine resmi dil, gündelik dil, yazım hatası, eksik noktalama, ağız özelliği ve eklerle uzayan sözcükler eklenmelidir. Azerbaycan Türkçesi ile Türkiye Türkçesi gibi yakın varyantlar da tek “Türkçe” etiketi altında varsayılmamalı; hedeflenen dil çeşidi açıkça sınanmalıdır.

3 Bilgi ve kültürel bağlam testleri

TR-MMLU, 62 bölümde 6.200 soruyla eğitim sistemi içindeki bilgi alanlarını ölçer. Cetvel ise dil anlama ve üretimin yanında Türkçe tarih, deyim ve kültürel içeriğe dayanan görevler sunar. TurkBench; bilgi, akıl yürütme, içerik güvenliği, dilbilgisi ve talimat takibini altı ana kategoride bir araya getirir.

Bu benchmarklar karşılaştırma için değerlidir, ancak ezberlenmiş veri riskini ortadan kaldırmaz. Test sorusu eğitim verisine girdiyse puan gerçek genellemeyi göstermeyebilir. Bu nedenle yayımlanmış setlerin yanında yeni, tarih kontrollü ve kurum içi sorular kullanılmalı; mümkünse aynı beceriyi farklı ifadelerle ölçen varyantlar hazırlanmalıdır.

4 Talimat takibi ve biçim güvenilirliği

Kullanıcı “yalnız tablo ver”, “beş maddeyi geçme” veya “kaynakta yoksa bulunamadı de” dediğinde modelin görevi ne kadar izlediği ayrı bir metriktir. Serbest metin kalitesi yüksek bir model, JSON şemasında fazladan açıklama ekleyerek otomasyonu bozabilir. Türkçe talimat eval'i; olumsuzluk, istisna, sıra ve koşul içeren görevleri de kapsamalıdır.

BoyutÖrnek metrikKritik hata
Dilİnsan tercihi, minimal çift doğruluğuAnlamı değiştiren ek/söz dizimi
BilgiExact match, çoktan seçmeli doğrulukKanıtsız kesin cevap
TalimatŞema ve kısıt uyumuİstenen formatı bozma
KaynakAtıf doğruluğu, faithfulnessKaynakta olmayan iddia
Operasyonp50/p95 gecikme, görev maliyetiTimeout veya yarım çıktı

5 RAG ve uzun belge değerlendirmesi

Kaynaklı sistemde iki farklı hata sınıfı vardır: retrieval doğru parçayı bulamayabilir veya model doğru parçayı gördüğü halde yanlış yorumlayabilir. Bunları ayırmadan yalnız son cevaba puan vermek, sorunun hangi katmanda olduğunu gizler. Retrieval için Recall@k ve nDCG; üretim için kaynak sadakati, alıntı doğruluğu ve eksik kanıtı belirtme oranı izlenebilir.

TR-MTEB gibi Türkçe embedding benchmarkları başlangıç noktasıdır. Fakat kendi PDF'lerinizde başlık, tablo, dipnot ve OCR hataları bulunduğu için gerçek doküman setiyle ayrıca test gerekir. Kaynaklı sistem tasarımını Türkçe RAG rehberinde ayrıntılandırıyoruz.

6 LLM-as-a-judge tek başına hakem olmasın

Güçlü bir modelle cevap puanlamak hızlıdır, ancak hakem model uzun cevabı, kendi üslubuna benzeyen metni veya belirli sunum biçimlerini tercih edebilir. Değerlendirme promptu, cevap sırası ve model kimliği sonucu etkileyebilir. Bu yüzden otomatik hakem sonuçları kör insan değerlendirmesiyle kalibre edilmeli ve kritik örneklerde kanıt kontrolü yapılmalıdır.

İki cevabı karşılaştırırken isimleri gizleyin, sıralarını değiştirin ve ölçütleri önceden yazın. Hakemler arası uyumu raporlayın. “Model A yüzde 12 daha iyi” demeden önce örnek sayısı ve belirsizlik aralığı açıklanmalıdır.

7 Production ölçümü: kalite kadar gecikme ve maliyet

Laboratuvar puanı iyi olan model, yoğun trafikte yavaşlayabilir veya araç çağrısında hata verebilir. p50 ve p95 ilk token süresi, toplam tamamlanma süresi, tool başarı oranı, tekrar deneme, fallback, token maliyeti ve kullanıcı düzeltme oranı birlikte izlenmelidir. Aynı görevi beş kez çalıştırmak da tutarlılık hakkında tek denemeden daha çok bilgi verir.

Sağlam seçim süreci üç aşamalıdır: açık benchmark ile eleme, kurumun altın setiyle kör karşılaştırma ve sınırlı production A/B testi. Böylece pazarlama etiketi yerine ölçülebilir kullanıcı başarısı üzerinden karar verilir.

Türkçe yapay zeka konu kümesi

Model kalitesinin tokenizer, eğitim verisi ve Türkçenin biçimbilimsel yapısıyla ilişkisini temel yazımızda inceleyin. Bu çerçevenin tokenizer, veri, uyarlama ve değerlendirme boyutları için Türkçe AI değerlendirme yaklaşımı yazısına bakabilirsiniz.

Kaynakça

  1. TR-MMLU.
  2. Cetvel.
  3. TurkBench.
  4. TurBLiMP.
  5. TR-MTEB.
  6. Zheng, L. ve ark. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena.

Türkçe öncelikli yapay zeka çalışma alanını deneyin

Belge analizi, web ve akademik arama, makale, sunum ve kaynaklı sohbet özelliklerini tek çalışma alanında kullanın.

DEHA'yı Ücretsiz Dene →