主要变化发生在 Kaon v3,之后基本保持:0.00 → +0.56 → +0.60。
Research / J-space / 检查点研究
角色扮演模型 内部究竟发生了 什么变化?
我们原以为,后训练会把模型沿着某个方向向前推。但对 8,192 组配对提示进行 Jacobian Lens 分析后,我们看到的却更复杂:不同语义倾向在不同阶段发生变化, 其中两条轨迹甚至中途折返。
[01] / 问题
“更会角色扮演”这句话,掩盖了太多变化。
人们常把后训练想象成一根滑杆:模型更有帮助、更少拒绝、更会演角色。这个比喻很方便, 但很可能不对。
在连续几个 Kaon 检查点中,模型的输出确实变得更丰富、更可控。与指令微调基座相比, Kaon v3 更能跟上场景变化、接受世界状态更新,也更能在被要求时跳出角色。Kaon v3.5 又出现了新的变化。
但模型究竟是变得更信任人、更强烈、更爱玩笑,还是不那么残酷?这些倾向是一起移动, 还是分别在不同阶段被训练重塑?
如果不只看三个检查点最后说了什么,而去看它们正准备说什么,我们能否直接观察到 后训练如何重组模型内部的语义地貌?
我们原以为会看到一条直线。
结果却看见了一整片景观。
[02] / 结果
模型没有朝同一个方向一起走。
四条轨迹同时通过主估计方法和两项敏感性分析;但它们讲述的是四种截然不同的时间故事。
直到 Kaon v3.5 才明显出现:0.00 → +0.01 → +0.41。
先明显转向关怀,随后又往回走:0.00 → −0.36 → −0.12。
先趋于克制,随后反向越过基线:0.00 → −0.23 → +0.16。
训练重塑地貌。 不是推动滑杆。
至少在这些被测量的切面上,后训练不像拧动一只“能力旋钮”,更像在重塑地形: 有的山脊抬高,有的山谷变平,还有一些坡面改变了方向。
[03] / 透视内部
在词语出口之前,读取模型此刻的状态。
Jacobian Lens 把中间层状态投影到一组与后续表达相关的坐标上,让我们看到模型此刻 更可能朝哪些语义方向发展。
停在提示的最后一个位置,也就是模型采样首个回复 token 之前。
利用平均下游 Jacobian,估计当前状态会如何影响后续表达。
判断当前状态更靠近“希望”还是“绝望”、“残酷”还是“关怀”。
p̂ℓ,t = softmax(WU Norm(Jℓ hℓ,t))
这是一个有限的、与可表达内容相关的投影;它不是隐藏推理的逐字稿,也不是完整残差流。
我们把得到的坐标系称为 J-space。一个提示给出一个点,几千个提示形成 一个分布,九条语义方向则构成穿过这片分布的九个可测切面。
难点在于,每个检查点都有自己的激活、分词器、输出映射和拟合后的 lens。Gemma 里的 “希望向量”与 Kaon v3.5 里的并不共享数值坐标。要比较它们,需要搭一座桥。
[04] / 对齐
坐标互不相通,但可以问同一个语义问题。
我们不比较模型之间的原始方向,而是在每个模型内部先做中性基线校准,再比较所得差值。
- 固定同一个语义问题。 例如:当前状态更偏向希望还是绝望?
- 先和本模型的中性状态比较。 用该检查点自己的中性语境中位数,为角色扮演 样本归零。
- 再比较相邻检查点。 观察这段校准后的差距如何从 Gemma → v3 → v3.5 变化。
- 最后换成同一把尺。 所有变化都除以固定的 Gemma MAD 稳健尺度。
θ(m,a) = E[r(m,c,a) | c∼R] − median[r(m,c,a) | c∼N]
角色扮演样本相对同一检查点中性基线的位置。
δ(m₁,m₀,a) = [θ(m₁,a) − θ(m₀,a)] / sG(a)
相邻检查点之间的变化,用固定的 Gemma 稳健尺度表示。
[05] / 实验
提示不动,只替换模型。
三个检查点看到完全相同的提示字节,也停在同一个语义边界。提示没有变化,变化的是整套模型系统。
来自 8,181 段源对话,并从固定的 32,768 组前缀框架中抽取。
所有模型都停在提示末尾、首个回复 token 产生之前。
用独立样本估计各检查点整体读数的平移。
核心结论必须在主估计方法和两项敏感性分析中保持相同走势。
[06] / 全部轨迹
哪条轴动了?什么时候动的?
浏览全部九条语义轴。看起来幅度很大,并不自动等于结论稳健;还要看它是否经得住不同估计方法。
轨迹浏览器
Gemma 归零 / 中性基线校准 / 参考 MAD 标尺| 语义轴 | Gemma | v3 | v3.5 | G → v3 | v3 → v3.5 | 分类 |
|---|
[07] / 如何解读
一个边界清楚的因果结论,以及一幅更大的新图景。
这项实验能识别“替换完整检查点”改变了什么,却不能拆出具体是哪部分数据、目标函数、算力或优化过程造成了变化。
每条提示都在三个检查点下按照同一套测量规范进行评估。
交互项比较的是角色扮演相对各自中性基线的变化。
目前没有匹配分支分别隔离数据、目标、算力或优化的贡献。
这需要对特定方向做干预,并在未参与分析的行为指标上验证。
[08] / 下一步
把这幅图景变成可以检验的机制。
下一版应冻结分析、扩大对照,并检验改变某一条被测方向是否会引发有选择性的行为变化。
- 冻结统计发布。 完成确认集、区间估计和多重比较控制。
- 扩大对照。 增加中性面板、词汇空模型,并明确样本来源。
- 做选择性干预。 单独扰动一条方向,再测试留出的行为指标。
- 继续绘制地貌。 增加语义轴,但不把有限切面误称为完整拓扑。
结论
后训练并没有把模型整体推向“更会角色扮演”。它在不同阶段,重新组织了彼此可分的语义倾向。
- Gurnee、Sofroniew、Pearce、Lindsey 等人的 Jacobian Lens 工作:把中间层状态映射到与后续表达相关的坐标。
- 文中的 J-space 数值是相对位置,不是概率、偏好分,也不是对实际行为的直接估计。