İçeriğe geç

Üretken Yapay Zeka & LLM

Türkçe değerlendirme setleri neden kendi başına bir problem

Türkçe için kendi değerlendirme setlerimizi neden sıfırdan kurduğumuz, otomatik çeviriyle hazırlanan setlerde karşılaşılan temel sorunlar ve alan terminolojisinin ölçümü nasıl bozduğu.

Türkçe değerlendirme setleri neden kendi başına bir problem

2 dakikalık okuma

Bir dil modelinin Türkçe'de ne kadar iyi olduğunu ölçmek, İngilizce'de aynı ölçümü yapmaktan farklı bir problem. Bu fark çoğu zaman geç fark ediliyor: uluslararası bir değerlendirme seti otomatik çeviriyle Türkçeye aktarılıyor, model yüksek puan alıyor, sonra sahada aynı model beklenenin çok altında çalışıyor.

Otomatik çeviri neyi bozuyor

İlk sorun biçimbilimsel. Türkçe eklemeli bir dil; İngilizce'de üç kelimeyle kurulan bir yapı Türkçe'de tek kelimeye iniyor. Bir sorunun zorluğu çeviri sırasında değişiyor — bazen kolaylaşıyor, bazen anlamsızlaşıyor. Çoktan seçmeli setlerde bu özellikle tehlikeli: çeldiriciler çeviri sonrası birbirinin aynısı hâline gelebiliyor ve model doğru cevabı eleme yoluyla buluyor.

İkinci sorun terminoloji. Alan terimlerinin çoğunun yerleşik bir Türkçe karşılığı yok; olanların da kurumdan kuruma değişen kullanımları var. Otomatik çeviri bu terimleri ya birebir çeviriyor ya da İngilizce bırakıyor. İki durumda da ortaya, o alanda çalışan bir uzmanın yazmayacağı bir metin çıkıyor. Model o metinde iyi sonuç veriyor ama kurumun gerçek belgelerinde vermiyor.

Üçüncüsü kültürel bağlam. Mevzuat, kurumsal yazışma biçimleri, tarih ve para formatları — bunların hiçbiri çeviriyle taşınmıyor. Türkçe bir sözleşmeyi anlamak, İngilizce bir sözleşmeyi anlayıp Türkçe yazmaktan başka bir yetenek.

Ne yapıyoruz

Çalıştığımız her alan için değerlendirme setini sıfırdan kuruyoruz. Süreç şöyle işliyor:

Kaynak metin kurumun kendi belgelerinden geliyor. Çeviri değil, gerçek kullanım. Bu, setin o kurumun terminolojisini ve yazım alışkanlıklarını taşımasını sağlıyor.

Soruları alan bilgisi olan kişiler yazıyor. Bir sorunun doğru cevabının ne olduğu konusunda uzlaşılamıyorsa o soru sete girmiyor. Belirsiz sorular ölçümü değil gürültüyü artırıyor.

Her soru için beklenen kaynak işaretleniyor. Model doğru cevabı verdi ama yanlış belgeye dayandırdıysa bunu ayrıca ölçüyoruz. Erişim-artırılmış sistemlerde bu ayrım kritik: doğru cevap şans eseri de gelebilir.

Set sürümleniyor. Model değiştiğinde ölçümün karşılaştırılabilir kalması için setin kendisinin sabit kalması gerekiyor. Sete soru eklemek yeni bir sürüm demek.

Neyi ölçmüyoruz

Genel dil yeteneğini ölçmeye çalışmıyoruz; bunun için zaten kamuya açık setler var. Bizim kurduğumuz setler dar ve alan-özel. Bir kurumun kendi verisi üzerinde çalışan bir sistemin, o kurumun sorularına ne kadar doğru cevap verdiğini ölçüyorlar. Bu setler başka bir kuruma taşınmıyor — taşınabilseydi zaten alan-özel olmazlardı.

Sonuç

Değerlendirme seti kurmak, model geliştirmenin yanında küçük bir iş gibi görünüyor ama değil. Ölçemediğiniz bir şeyi iyileştiremiyorsunuz; yanlış ölçtüğünüzde ise yanlış yöne doğru iyileştiriyorsunuz. Türkçe çalışan her sistemde ilk yatırımı buraya yapıyoruz.

Paylaş

Yapay zeka projeniz için teknik değerlendirme

Projenizin fizibilitesi, riskleri ve takvimi teknik görüşmede değerlendirilir.