模型内部 · 五篇路线
从 Activation 走到 Agent 行为
Agent 改了一个文件,并不等于“模型直接动了磁盘”。这组文章按时间顺序分开 weights、activation、无声与可见推理、tool call、runtime 和环境结果,再讨论哪些内部证据真的支持因果判断。
阅读边界:内部读数是仪器,不是模型的逐字自传。每篇都会区分相关性、干预得到的因果证据和关于“模型在想什么”的解释。

阅读路线
先建立全景,再逐层读出、识别与干预
五篇共用一条保留期修改任务,让每个概念都落到输入、状态、工具调用与文件结果上。
01 · 全景从 Activation 到 Agent 行为跟随一次文件修改,分清模型计算、工具调用提案、runtime 执行,以及 activation、KV 缓存和持久记录。
阅读第一篇 →
02 · WorkspaceJ-space 与 Silent Reasoning区分 J-lens 读取、稀疏重构与因果干预,跟随官方 jlens 实现核对拟合、读数和复现边界。
阅读第二篇 →
03 · ReadoutCoT Monitoring、NLA、SAE 与 Latent Reasoning比较 CoT、NLA、SAE 与 J-lens 的证据边界,并从 Coconut 源码理解连续思维。
阅读第三篇 →
04 · IdentityPersona、自我模型与 Post-training从角色方向的提取、Assistant axis 与单侧 capping,理解 post-training 如何稳定角色,以及自我模型证据的限度。
阅读第四篇 →
05 · InterventionActivation Steering、Reflection Training 与 Alignment Auditing对照 ActAdd 与 CAA 的注入位置,区分推理时干预、reflection training 与独立审计,以及各自的验证和回滚条件。
阅读第五篇 →