模型内部 · 五篇路线

从 Activation 走到 Agent 行为

Agent 改了一个文件,并不等于“模型直接动了磁盘”。这组文章按时间顺序分开 weights、activation、无声与可见推理、tool call、runtime 和环境结果,再讨论哪些内部证据真的支持因果判断。

阅读边界:内部读数是仪器,不是模型的逐字自传。每篇都会区分相关性、干预得到的因果证据和关于“模型在想什么”的解释。

从模型内部 activation 流向 Agent 行动的全景图

阅读路线

先建立全景,再逐层读出、识别与干预

五篇共用一条保留期修改任务,让每个概念都落到输入、状态、工具调用与文件结果上。