@NeelNanda Saya menemukan pembahasan Anda tentang interpretabilitas neural network sangat menarik. Itu membuat saya memikirkan sebuah pertanyaan yang lebih mendasar. kita dapat mengidentifikasi kapan suatu mekanisme bekerja dan melakukan intervensi terhadapnya, tetapi kita tetap perlu menemukan apa sebenarnya makna mekanisme tersebut dan dari mana perilakunya berasal pada tingkat yang lebih fundamental.
Ini dekat dengan pertanyaan yang sedang saya eksplorasi dalam penelitian saya sendiri, daripada hanya menginterpretasikan mekanisme yang muncul dari sistem yang belajar, dapatkah kita memulai dari mekanisme, constraint, state, dan boundary yang didefinisikan secara eksplisit, lalu mengujinya secara eksperimental untuk melihat apakah mekanisme tersebut benar-benar menghasilkan perilaku yang kita amati?
Menurut saya pertanyaannya bukan pendekatan mana yang lebih baik, tetapi seberapa jauh kita dapat membuat mekanisme suatu sistem kecerdasan benar-benar dapat dipahami secara eksperimental dan diaudit secara kausal.