Makine Öğrenmesi Modelleri Eğitimde Nasıl Doğrulanır?

|

6 dk. okuma

Okul öncesi sınıfında öğretmen ve çocuklar

Eğitim teknolojilerinde "yapay zekâ destekli" ifadesi giderek yaygınlaşıyor. Peki bir modelin çocuklar hakkında verdiği bir tahmine ne zaman güvenebiliriz? Bir modeli değerlendirirken bakılan temel kavramları teknik ayrıntıya girmeden özetledik.

Model ezberleyebilir

Bir makine öğrenmesi modeli, geçmiş verilerdeki örüntülerden öğrenir. En büyük tuzak, modelin genellenebilir örüntüler yerine eğitildiği veriye özgü ayrıntıları ezberlemesidir (aşırı öğrenme). Böyle bir model, eğitildiği veride çok başarılı görünür. Yeni çocuklarla karşılaşınca başarısı belirgin biçimde düşer. Bu yüzden bir modelin başarısı, hiçbir zaman eğitildiği veriyle ölçülmez.

Eğitim, doğrulama ve test verisi

  • Eğitim verisi: Modelin örüntüleri öğrendiği veri.
  • Doğrulama verisi: Model ayarlarının seçildiği, eğitimde kullanılmayan veri.
  • Test verisi: Bütün kararlar verildikten sonra yalnızca bir kez kullanılan ve modelin gerçek başarısını gösteren veri.

Veri az olduğunda çapraz doğrulama kullanılır: veri birkaç parçaya bölünür, model her seferinde bir parçayı dışarıda bırakarak eğitilir ve dışarıda bırakılan parçada sınanır. Sonuçların ortalaması, tek bir bölmeye göre daha güvenilir bir başarı tahmini verir.

Hangi ölçütlere bakılmalı?

Erken uyarı amaçlı bir modelde tek başına "doğruluk oranı" yanıltıcı olabilir. Riskli çocukların az olduğu bir grupta herkesi "risksiz" diyen bir model bile yüksek doğruluk gösterir ama hiçbir işe yaramaz. Bu yüzden şu ölçütler birlikte değerlendirilir:

  • Duyarlılık: Gerçekten risk taşıyan çocukların ne kadarının yakalandığı.
  • Özgüllük: Risk taşımayan çocukların ne kadarının doğru biçimde risksiz sayıldığı.
  • ROC eğrisi altındaki alan: Modelin farklı eşiklerde riskliyi risksizden ayırma gücünün özeti.
  • Kalibrasyon: Modelin verdiği olasılıkların gerçekte gözlenen oranlarla ne kadar örtüştüğü.

Dış doğrulama ve adalet

Bir model, geliştirildiği okullardan farklı bir bölgede, farklı bir sosyoekonomik yapıda ya da farklı bir yaş dağılımında aynı başarıyı göstermeyebilir. Bu yüzden iyi bir model, geliştirilmesinde hiç kullanılmamış bağımsız bir örneklemde de sınanır. Ayrıca modelin farklı alt gruplarda (örneğin kız ve erkek çocuklar, iki dilli çocuklar) benzer hatalar yapıp yapmadığı ayrıca incelenmelidir.

Okullar ne sormalı?

  • Model hangi yaş grubunda ve kaç çocukla geliştirildi?
  • Başarısı bağımsız bir örneklemde sınandı mı?
  • Duyarlılık ve özgüllük değerleri nedir, eşik nasıl seçildi?
  • Sonuçlar karar destek amacıyla mı sunuluyor, yoksa tanı gibi mi?
  • Çocuk verisi model geliştirmek için kullanılıyorsa bunun hukuki dayanağı ve anonimleştirme yöntemi nedir?

Bu soruların açık yanıtları olmayan bir sistemde, "yapay zekâ" ifadesi bir güvence değil, bir pazarlama terimidir. Eğitimde kullanılan her model, son kararı veren insan uzmana yardımcı olacak şekilde konumlanmalıdır.

Bu yazı bilgi vermek içindir, tanı ya da tedavi önerisi yerine geçmez. Çocuğunuzla ilgili bir kaygınız varsa okulunuzun rehberlik servisine ya da bir uzmana danışın.

|

5 dk. okuma

Oyunlaştırma Ölçme Geçerliliğini Bozar mı?

Çocuk eğlenirken güvenilir veri toplamak mümkün mü? Tasarım ilkeleri.

|

5 dk. okuma

Yanlış Pozitif ve Yanlış Negatif: Tarama Araçlarının İkilemi

Bir erken uyarı sisteminin hangi hatayı göze alması gerektiği tartışması.

|

5 dk. okuma

Tepki Süresi Neden Doğru Cevaptan Fazlasını Anlatır?

Mikrodavranışsal verilerin, sonuç odaklı skorların göremediği süreci nasıl açtığı üzerine.

MinikUp