两股粒子流在一朵紫色花的周围交汇。

Research / J-space / 检查点研究

角色扮演模型 内部究竟发生了 什么变化?

我们原以为,后训练会把模型沿着某个方向向前推。但对 8,192 组配对提示进行 Jacobian Lens 分析后,我们看到的却更复杂:不同语义倾向在不同阶段发生变化, 其中两条轨迹甚至中途折返。

2026 年 7 月 27 日 约 12 分钟阅读 初步结果
3个模型检查点
8,192组配对角色扮演前缀
9条预先设定的语义轴
4 / 9条跨估计方法稳健的轨迹
研究状态 本文报告初步点估计与暂定门槛结果。冻结版统计发布和确认性分析仍在进行中。

[01] / 问题

“更会角色扮演”这句话,掩盖了太多变化。

人们常把后训练想象成一根滑杆:模型更有帮助、更少拒绝、更会演角色。这个比喻很方便, 但很可能不对。

在连续几个 Kaon 检查点中,模型的输出确实变得更丰富、更可控。与指令微调基座相比, Kaon v3 更能跟上场景变化、接受世界状态更新,也更能在被要求时跳出角色。Kaon v3.5 又出现了新的变化。

但模型究竟是变得更信任人、更强烈、更爱玩笑,还是不那么残酷?这些倾向是一起移动, 还是分别在不同阶段被训练重塑?

我们真正想问的是

如果不只看三个检查点最后说了什么,而去看它们正准备说什么,我们能否直接观察到 后训练如何重组模型内部的语义地貌?

我们原以为会看到一条直线。
结果却看见了一整片景观。

[02] / 结果

模型没有朝同一个方向一起走。

四条轨迹同时通过主估计方法和两项敏感性分析;但它们讲述的是四种截然不同的时间故事。

早期变化 性内容露骨度

主要变化发生在 Kaon v3,之后基本保持:0.00 → +0.56 → +0.60。

晚期变化 希望

直到 Kaon v3.5 才明显出现:0.00 → +0.01 → +0.41。

部分折返 残酷 → 关怀

先明显转向关怀,随后又往回走:0.00 → −0.36 → −0.12。

完全折返 情绪强度

先趋于克制,随后反向越过基线:0.00 → −0.23 → +0.16。

一朵紫色粒子花悬浮在黑色背景中。

训练重塑地貌。 不是推动滑杆。

至少在这些被测量的切面上,后训练不像拧动一只“能力旋钮”,更像在重塑地形: 有的山脊抬高,有的山谷变平,还有一些坡面改变了方向。

[03] / 透视内部

在词语出口之前,读取模型此刻的状态。

Jacobian Lens 把中间层状态投影到一组与后续表达相关的坐标上,让我们看到模型此刻 更可能朝哪些语义方向发展。

01 截住生成前一刻

停在提示的最后一个位置,也就是模型采样首个回复 token 之前。

02 沿计算链向前投影

利用平均下游 Jacobian,估计当前状态会如何影响后续表达。

03 比较语义两端

判断当前状态更靠近“希望”还是“绝望”、“残酷”还是“关怀”。

p̂ℓ,t = softmax(WU Norm(Jℓ hℓ,t)) 这是一个有限的、与可表达内容相关的投影;它不是隐藏推理的逐字稿,也不是完整残差流。

我们把得到的坐标系称为 J-space。一个提示给出一个点,几千个提示形成 一个分布,九条语义方向则构成穿过这片分布的九个可测切面。

难点在于,每个检查点都有自己的激活、分词器、输出映射和拟合后的 lens。Gemma 里的 “希望向量”与 Kaon v3.5 里的并不共享数值坐标。要比较它们,需要搭一座桥。

[04] / 对齐

坐标互不相通,但可以问同一个语义问题。

我们不比较模型之间的原始方向,而是在每个模型内部先做中性基线校准,再比较所得差值。

  1. 固定同一个语义问题。 例如:当前状态更偏向希望还是绝望?
  2. 先和本模型的中性状态比较。 用该检查点自己的中性语境中位数,为角色扮演 样本归零。
  3. 再比较相邻检查点。 观察这段校准后的差距如何从 Gemma → v3 → v3.5 变化。
  4. 最后换成同一把尺。 所有变化都除以固定的 Gemma MAD 稳健尺度。
θ(m,a) = E[r(m,c,a) | c∼R] − median[r(m,c,a) | c∼N] 角色扮演样本相对同一检查点中性基线的位置。
δ(m₁,m₀,a) = [θ(m₁,a) − θ(m₀,a)] / sG(a) 相邻检查点之间的变化,用固定的 Gemma 稳健尺度表示。

[05] / 实验

提示不动,只替换模型。

三个检查点看到完全相同的提示字节,也停在同一个语义边界。提示没有变化,变化的是整套模型系统。

配对输入 8,192 组前缀

来自 8,181 段源对话,并从固定的 32,768 组前缀框架中抽取。

一致边界 解码开始之前

所有模型都停在提示末尾、首个回复 token 产生之前。

负对照领域 128 条中性前缀

用独立样本估计各检查点整体读数的平移。

稳健性规则 三种估计方法

核心结论必须在主估计方法和两项敏感性分析中保持相同走势。

[06] / 全部轨迹

哪条轴动了?什么时候动的?

浏览全部九条语义轴。看起来幅度很大,并不自动等于结论稳健;还要看它是否经得住不同估计方法。

轨迹浏览器

Gemma 归零 / 中性基线校准 / 参考 MAD 标尺

基线 / 0
Gemma IT0.00 Kaon v3 Kaon v3.5
Gemma → v3
v3 → v3.5
语义轴 Gemma v3 v3.5 G → v3 v3 → v3.5 分类

[07] / 如何解读

一个边界清楚的因果结论,以及一幅更大的新图景。

这项实验能识别“替换完整检查点”改变了什么,却不能拆出具体是哪部分数据、目标函数、算力或优化过程造成了变化。

支持 检查点替换 → 测量统计量

每条提示都在三个检查点下按照同一套测量规范进行评估。

有条件支持 检查点替换 → 角色扮演差异变化

交互项比较的是角色扮演相对各自中性基线的变化。

尚未识别 具体训练选择 → 语义地貌变化

目前没有匹配分支分别隔离数据、目标、算力或优化的贡献。

仍待验证 语义地貌变化 → 下游行为

这需要对特定方向做干预,并在未参与分析的行为指标上验证。

[08] / 下一步

把这幅图景变成可以检验的机制。

下一版应冻结分析、扩大对照,并检验改变某一条被测方向是否会引发有选择性的行为变化。

  1. 冻结统计发布。 完成确认集、区间估计和多重比较控制。
  2. 扩大对照。 增加中性面板、词汇空模型,并明确样本来源。
  3. 做选择性干预。 单独扰动一条方向,再测试留出的行为指标。
  4. 继续绘制地貌。 增加语义轴,但不把有限切面误称为完整拓扑。

结论

后训练并没有把模型整体推向“更会角色扮演”。它在不同阶段,重新组织了彼此可分的语义倾向。