İngiltere Yapay Zeka Güvenlik Enstitüsü, Stanford, Berkeley ve Oxford üniversiteleri dahil 14 kurumdan 29 araştırmacı, yapay zekanın güvenliği ve etkinliğini ölçen 445 değerlendirme testinde ciddi kusurlar buldu. “Önemli Olanı Ölçmek: Büyük Dil Modeli Kıyaslamalarında Yapı Geçerliği” başlıklı çalışma, doğal dil işleme ve makine öğrenimi alanlarındaki önde gelen konferanslardan alınan testleri inceledi.
Araştırma, testlerin neredeyse tamamında “sonuçların geçerliliğini zedeleyebilecek” hatalar olduğunu ortaya koydu. Oxford İnternet Enstitüsü’nden Andrew Bean, The Guardian’a yaptığı açıklamada, bu testlerin büyük teknoloji şirketlerinin yeni yapay zeka modellerini değerlendirmek için kullanıldığını belirtti. Bean, “Değerlendirme testleri, yapay zeka iddialarının temelini oluşturuyor. Ortak tanımlar ve sağlıklı ölçümler olmadan modellerin gerçekten gelişip gelişmediğini anlamak zor” dedi.
Çalışma, testlerdeki eksikliklerin, modellerin performansını yanlış yansıtabileceğini ve güvenilirliklerini sorgulattığını vurguluyor. Bilim insanları, daha sağlam ve standartlaştırılmış değerlendirme yöntemleri çağrısında bulundu.

