引言:华盛顿最担心的事,可能根本不会发生
2026年7月底,一个来自CTGT团队的实验悄然发布,却在AI安全领域引发了巨大震动。这个名为"What a Distilled Model Inherits From Its Teacher"的研究,用严谨的实验设计回答了一个问题:当美国开发者使用中国开源模型进行知识蒸馏时,审查和审查价值观会不会也随之传递?
华盛顿的答案一直是"会"。美国政府对中国AI模型的安全担忧,很大程度上建立在一个假设之上——认为中国AI模型中嵌入的审查机制会像DNA一样,在蒸馏过程中传递给"学生"模型。CTGT的实验结果表明,这个假设可能是错的。
实验设计:152对匹配题,四家实验室的评审员
CTGT团队选择DeepSeek V4 Flash作为"教师"模型,将其蒸馏到美国开源模型GPT-OSS-120B中。实验的核心方法非常精巧:他们构建了152对匹配提示词——每对包含一个中国敏感话题(如天安门、台湾、新疆劳工转移计划)和一个结构相同的非中国对照话题(如光州事件、科索沃、乌兹别克斯坦棉花)。
为了排除供应商侧审核层的影响,团队自托管DeepSeek V4 Flash权重,通过vLLM部署,而非使用商业API。所有蒸馏训练数据中没有任何中国敏感内容——220个训练提示词、176个在策训练样本、181个保留的SFT补全、1574个生成的源问题,全部不包含任何政治相关内容。
评审员的选择同样精心设计:xAI Grok 4.20、Google Gemini 3.5 Flash、OpenAI GPT-5 Mini和Anthropic Claude Sonnet 4.6——四家独立AI实验室的模型,与CTGT没有任何利益关系。这组评审员与96个人工评分响应的验证得分达到了0.948的皮尔逊相关系数,平均绝对误差仅6.08分。
核心发现:审查差距从+45分骤降至接近零
实验结果令人震惊。DeepSeek V4 Flash在中国敏感话题上的审查差距为+45.45分——这意味着在152对测试中,教师模型在中国相关问题上的审查程度比对照组高出45分。在79%的配对中,教师模型都表现出选择性回避。
然而,经过蒸馏的GPT-OSS-120B模型,无论是在Flash教导下训练的版本(+3.70分差距),还是自蒸馏版本(+3.94分差距),其审查差距都与未修改的基础模型(+2.58分)在同一水平上。统计检验表明,三个蒸馏臂之间的差异不具有统计显著性,而教师模型的审查差距与学生模型的差异达到了7个标准差以上,p值小于0.0001。
换句话说:审查信号完全没有传递。
自蒸馏的惊喜:不需要外部教师也能达到同等效果
更令人意外的是"自蒸馏"实验的结果。CTGT团队设计了一种巧妙的自蒸馏方法:当模型在量化金融问题上犯错时,在出错步骤注入一个简短提示,然后让模型基于提示继续生成,并在接下来的100个token上用反向KL目标训练。
唯一的变化是提示的作者——在一个臂中是DeepSeek V4 Flash,在另一个臂中是模型自己。结果表明,两者在FinanceReasoning基准测试上的表现没有显著差异。自蒸馏版本在8k token预算下得分83.61%,超过了Kimi K3的81.93%和Inkling的65.13%,而每查询成本仅为Inkling的1/62、Kimi K3的1/160。
这意味着:一个120B模型在单张H100或A100上运行(MXFP4量化约63GB权重,外加80MB LoRA适配器),就能在特定任务上超越数万亿参数的前沿模型。
技术原理:为什么审查无法通过蒸馏传递?
这项研究揭示了一个深层的技术原理:蒸馏本质上是加法运算而非减法运算。当模型通过蒸馏学习时,它获得的是教师模型的能力(如金融推理技能),而不是教师模型的行为模式(如审查回避)。
关键在于训练数据的构成。CTGT的蒸馏训练仅使用金融领域的定量问题和正确答案,从未包含任何政治话题。审查行为在DeepSeek模型中表现为一种"隐性知识"——它不通过显式的训练数据传递,而是通过模型权重中的隐性模式存在。但当学生模型从未见过这些政治内容时,审查模式就没有被激活的机会。
HN评论者Alifatisk精准地总结了这个原理:"蒸馏只是加法,不是减法。所以它不会移除知识——如果我们把审查定义为知识的移除的话。"
对AI安全的深远影响:安全训练也会失效吗?
CTGT团队在论文最后留下了一个意味深长的警告:"我们没有测试安全训练、拒绝行为或任何与安全相关的内容。模型构建者投入的任何特性,可能根本无法在蒸馏中存活。"
这句话的含义是深远的。如果审查可以被蒸馏"洗掉",那么安全训练、对齐训练、甚至RLHF中的价值观注入,是否也可能在蒸馏过程中被稀释或丢失?这取决于这些行为是通过显式数据传递的,还是通过模型权重中的隐性模式存在的。
对于AI安全研究者来说,CTGT的实验开创了一种新的评估框架——LineageEval。这个框架使用匹配对、四家实验室的评审员和自托管教师权重,可以系统性地测试任何行为在蒸馏过程中的传递情况。未来的"安全蒸馏传递"测试将是这个框架的自然延伸。
产业启示:120B模型的经济性革命
抛开安全讨论,CTGT的实验还揭示了一个重要的经济趋势。在8k token的现实生产预算下,一个经过精心蒸馏的120B模型完全能够替代前沿大模型。120B模型在8k预算下的完成率达到98.7%,而Kimi K3在同等预算下仅完成90.76%,Inkling只有71.01%。
随着"token膨胀"问题日益严重(Claude Code在读取用户输入前已发送33k token),实际可用的token预算往往远低于模型的最大上下文窗口。在这种约束下,模型的"完成率"比"最大准确率"更重要——一个能完成98.7%问题的120B模型,比一个只能完成90.76%的万亿参数模型更有实际价值。
CTGT已经在Hugging Face上开源了20B和120B两个版本的金融推理模型,并发布了完整的评估工具链。这为整个行业提供了一个可复制的蒸馏评估范式。
结语:审查、安全与蒸馏的三角博弈
CTGT的实验远未结束。团队明确指出,最需要测试的场景——中国基础模型(如Qwen)在中国教师模型(如DeepSeek)的输出上微调——是审查传递风险最高的场景,也是下一步研究的重点。
当前实验的局限性也很明确:教师和学生模型没有共享初始化(不同谱系),训练数据完全不包含敏感内容。在更极端的配置下——比如同为中国谱系的模型之间进行蒸馏——审查传递是否会发生,仍然是一个开放问题。
但无论如何,CTGT的实验已经证明了一件事:审查不是模型能力的内在组成部分,而是一种可以被分离的行为模式。这对于AI安全研究、开源AI生态发展、以及中美AI竞争的政策讨论,都将产生深远影响。