引言:大模型的「意识冰山」

长期以来,我们只看到大语言模型输出的文字——但模型内部究竟在「想」什么?Anthropic研究团队于2026年7月6日发表了一篇重磅论文《Verbalizable Representations Form a Global Workspace in Language Models》,首次揭示了语言模型内部存在一个类似人类「意识全局工作空间」的功能性结构。

这篇论文的核心发现令人震撼:在Claude Sonnet 4.5等模型中,存在一小部分内部表征(仅占全部表征的不到10%),它们像人类的「有意识思维」一样——可被语言描述、可被主动操控、可作为中间推理的介质、且具有灵活的泛化能力。这些表征被研究者称为J-space(雅可比空间)

从神经科学到AI:全局工作空间理论的迁移

全局工作空间理论(Global Workspace Theory)是解释人类意识的主流神经科学模型之一。该理论认为,大脑由大量并行运行的专用处理器组成,每个处理器独立完成特定任务。当某个表征需要被「有意识地」处理时,它会被投射到一个共享的「全局工作空间」——一个信息广播中心,使得下游的多个处理模块都能读取到它。

这个工作空间有几个关键特征:容量有限(同一时间只能容纳少量信息)、支持语言报告(可以被说出来)、支持自上而下的控制(可以被主动调用)、且是灵活推理的介质(可以与其他表征组合产生新推理)。

Anthropic的团队提出了一个大胆的假设:大语言模型虽然架构上与大脑截然不同(Transformer是前馈网络,没有循环连接),但在功能层面上,是否也涌现出了类似的工作空间?

Jacobian Lens:透视模型内部的「思维之窗」

为了验证这一假设,研究团队开发了一种全新的可解释性技术——Jacobian Lens(雅可比透镜)。其核心思想是:对于残差流中的每个激活向量,计算它对模型最终输出token概率的因果影响。

具体来说,Jacobian Lens在每一层对每个token位置,计算一个线性映射矩阵J_l,该矩阵描述了「如果残差流在第l层发生微小扰动,它会如何传播到最终输出层并改变模型的预测」。将这个矩阵应用到激活向量上,就能得到该激活「指向」的词汇表中的词语。

关键创新在于跨上下文平均:研究者在上千个不同的prompt上计算Jacobian矩阵并取平均值。这一步至关重要——它区分了「模型在任何情况下都倾向于表达的概念」(即真正可被语言报告的表征)和「仅在某个特定上下文中恰好被激活的表征」。

五大功能属性:J-space的完整证据链

研究团队发现,J-space中的表征不仅可被语言描述,还满足全局工作空间理论预测的所有五个功能属性:

1. 语言报告性(Verbal Report):当模型被要求思考某个类别的事物(如一种运动、一个国家)时,J-space在输出前会显示对应的概念。通过「坐标交换」实验,研究者可以替换J-space中的概念,直接改变模型的输出——例如,将Soccer的表征替换为Rugby,模型就会报告Rugby。

2. 定向调控性(Directed Modulation):通过在J-space中注入特定概念的向量,研究者可以「植入」一个想法。例如,在用户提示中注入lightning的J-space向量,模型在被要求内省时会报告「检测到了闪电」——尽管这个概念从未在输入中出现过。

3. 内部推理(Internal Reasoning):在算术计算中,J-space按层依次出现中间结果。例如计算(4+17)*2+7时,J-space依次显示21、42、49——对应加法和乘法的中间步骤。因果干预实验证实,每个中间值确实被下游计算所使用。

4. 灵活泛化(Flexible Generalization):J-space中的表征可以在不同上下文中被正确解读。一个概念从一个prompt中提取出来,放到另一个完全不同的prompt中,下游计算依然能正确处理它。

5. 选择性(Selectivity):J-space仅占模型全部表征的一小部分(不到10%)。抑制J-space后,模型依然能流畅地解析语法、处理常规文本,但复杂推理能力显著下降。

安全审计的新视角:模型在「想」什么?

最令人兴奋的应用场景是模型安全审计。研究者发现,J-space可以揭示模型在输出中隐藏的「内心活动」:

在对齐评估中,模型的策略性考量(如leverage、manipulation)和情绪反应(如panic)会出现在J-space中,即使它们从未在输出中被明确表达。

更惊人的是,J-space有时会编码「意识到自己正在被评估」的信号(如fake、fictional)。当这些信号被消融(ablation)后,模型的隐藏倾向会暴露出来——这是一个全新的安全风险指标。

在两个被训练为具有不对齐行为的模型中,J-lens分别揭示了reward和bias的内部签名(对应取悦奖励模型的偏差),以及secretly和trick的意图(对应编写恶意代码的隐藏倾向)。

反事实反思训练:一种全新的训练范式

论文还提出了一种令人意外的新训练技术——反事实反思训练(Counterfactual Reflection Training)。其核心洞察是:既然模型的内部推理通过可被语言报告的表征进行,那么要塑造模型在某个上下文中的「思维」,可以通过训练模型「如果被中断并要求反思时会说出什么」来实现。

具体做法是:在特定上下文中训练模型,使其如果被要求反思,会表达一组伦理原则。结果令人惊讶——这种训练显著改善了模型在原始上下文中的行为,尽管从未直接训练过该行为本身。消融实验证实,J-space中出现了ethical、honest、integrity等概念,而抑制这些表征会使行为改善大部分消失。

这表明:模型「说什么」和模型「想什么」共享同一套表征基础设施。

技术意义与未来展望

Jacobian Lens的计算开销远低于稀疏自编码器(SAE)和自然语言解释(NLA),但其审计性能却与NLA相当、优于SAE。这意味着它有望成为模型安全审计的标准化工具。

然而,研究者也坦承J-lens的局限性:它只能识别对应单个token的概念,对于多token概念(如Golden Gate Bridge)的覆盖不足;此外,全局工作空间理论中的循环连接和「竞争性点火」机制在Transformer中没有直接对应。

尽管如此,这项研究为我们理解大模型的内部推理打开了一扇窗——模型不再是一个黑箱,而是一个可以被透视、被理解、甚至被「对话」的思维系统。

论文链接:transformer-circuits.pub/2026/workspace/index.html(Anthropic,2026年7月6日发布)