2023
我們理解自己造出的東西嗎?
切法
把神經網路當成一個有機體:描繪它的迴路、為它的特徵命名、在權重上做生物學。
可解釋性作為一個領域——一種被嚴謹化的坦承:我們培育出了某個自己還讀不懂的東西。
Zoom In: An Introduction to Circuits2020張力
可解釋性把那個經典的問題倒了過來。對於在此之前的每一台機器,我們理解其機制,而去追問它的行為。在這裡,行為運作正常,我們反而去追問它的機制。是我們造了它、訓練了它,我們能盯著每一個權重看——而我們依然說不出,以一個工程師所指的那種方式,它為何做出它所做的事。