Yorumlanabilirlik ve güvenlik araştırmaları: Modelin içinde ne olduğunu anlama çabası
Bu alanın önemi şu: modeller büyük ölçüde kara kutu. Doğru cevap veriyor ama neden verdiğini bilmiyoruz. Bu, kritik alanlarda kullanımın önündeki en büyük engel.
Yorumlanabilirlik çalışmaları, model içindeki belirli kavramların hangi bileşenlerde temsil edildiğini bulmaya çalışıyor. Bazı çalışmalarda belirli kavramların izole edilip güçlendirilebildiği veya bastırılabildiği gösterildi. Bu hem anlama hem kontrol açısından önemli.
Bir diğer yayın alanı, modellerin istenmeyen davranışlarının nasıl ortaya çıktığı ve eğitim sürecinde nasıl azaltılabileceği.
Yayınlar teknik ama çoğunun başında genel okuyucuya yönelik özet bölümü var. Alanın nereye gittiğini anlamak için bu özetler yeterli.
Bu tür araştırmaları takip etmek, modellerin ne yapıp ne yapamayacağı konusunda gerçekçi bir bakış kazandırıyor.

@titus