Pekiştirmeli Öğrenme & Karar Sistemleri
Değişen koşullara uyum sağlayan karar politikaları, ödül tasarımı, simülasyonda eğitim ve sahaya güvenli aktarım.

Neden bu alanda çalışıyoruz
Bazı problemlerde doğru cevap sabit değil: karşı taraf da davranışını değiştiriyor. Statik bir kural seti ya da bir kez eğitilmiş bir sınıflandırıcı bu durumda öngörülebilir hale geliyor, öngörülebilir olan da aşılıyor.
Pekiştirmeli öğrenme bu problem sınıfına yanıt veriyor, ama kendi zorluklarını getiriyor: ödül yanlış tasarlandığında sistem istediğiniz şeyi değil ödülü optimize ediyor. Çalışmalarımızın ağırlığı bu yüzden ödül tasarımı ve güvenli keşif üzerinde.
Ne üzerinde çalışıyoruz
- Ödül tasarımı ve ödül manipülasyonunun (reward hacking) tespiti
- Simülasyonda eğitip sahaya aktarma; simülasyon–gerçeklik farkının kapatılması
- Dil modelleriyle birlikte çalışan karar politikaları
- Güvenli keşif: sistemin öğrenirken geri alınamaz bir hata yapmasının önlenmesi
- Çok adımlı kararlarda başarının nasıl ölçüleceği ve politika regresyonunun yakalanması
Araştırma projelerimizden
Bu alandaki iki destekli projemiz de aynı fikirden çıkıyor: koruma stratejisi sabit kaldığında öngörülebilir oluyor. Hem yazılım koruma hem tehdit tespiti sistemlerimiz, karşılaştıkları duruma göre stratejilerini pekiştirmeli öğrenmeyle güncelliyor.
Yapay zeka projeniz için teknik değerlendirme
Projenizin fizibilitesi, riskleri ve takvimi teknik görüşmede değerlendirilir.