8月13日至20日这一周,AI 行业在模型、合规、资本与工程实践四个层面同时剧烈变动。谷歌与 Anthropic 各落一子布局模型与新规,Nvidia 与 OpenAI 的千亿美元数据中心博弈进入新阶段,OpenAI 的上市时间表首次被高管公开确认,而 Asana 的工程案例则让「Agent 重写存量代码」从口号变成了可复制的收益模型。以下是本期五大热点。

一、谷歌发布 Gemini 3.7 Flash:更聪明的「千里马」,引入价直接砍半

8月13日,谷歌在 3.6 Flash 发布仅三周后再度放量,推出号称「迄今最智能的工作马模型」的 Gemini 3.7 Flash,主打编程与 Agent 工作负载,引入价格只有 3.6 Flash 原价的一半——每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。基准答卷全面跃升:FrontierCode 1.1 Main 从 34.4% 提到 43.6%,DeepSWE v1.1 从 49.0% 升到 65.3%,WebDev Arena 的 Elo 从 1538 涨到 1588。

尤其亮眼的是知识密集型场景:专测复杂文档理解的 GDP.pdf 从 22.0% 跳到 34.0%,Zapier 的 AutomationBench 从 17.0% 翻到 30.4%,说明它在金融、法律、生物等需要读长文档的行业更能打。除开发者 API 外,Google AI Pro/Ultra 用户的 24/7 个人智能体「Gemini Spark」也同步切换到新模型(来源:blog.google)。

开发者体验同样升级:遇到卡点时模型更会主动澄清意图、做更长的多步规划与工具调用,需要的人工检查与重试明显减少;安全层面也同步加强了 CBRN(化生放核)与网络攻击方向的滥用防护。在推理成本持续下探的大趋势里,用「打折价」换「更强代码能力」的定价策略,显然是要把 Agent 开发者的增量需求牢牢握在手里。

二、Claude 全面文本水印上线:创作自由与合规的拉扯

为满足欧盟《人工智能法案》及约 190 名签署方的《透明度行为准则》,Anthropic 宣布为全部 Claude 文本输出注入不可见水印,且全球生效。技术路线采用 Google DeepMind 2024 年发表于《自然》的 SynthID-Text——利用每一处「低风险随机选词」(如同义近义词的选择)改变随机数来源,让持有密钥者可评估文本由 Claude 生成的概率,原理可追溯至 Scott Aaronson 2022 年的提议。

官方承诺水印不影响质量、不增加 token、不变价格、无法追溯到个人,并预告将推出水印检测 API;图片与文件输出则改为开放标准的 C2PA 内容凭证。争议随之而来:John Gruber 以「文字掺假、对写作的亵渎」发文抨击,社区观点分裂——反对者认为强制水印削弱人类创作主权,支持者则认为这是欧盟合规的必要代价。

技术上也存在明确边界:在事实性极强的句子(如「牛顿最著名的著作是《原理》」)里几乎无可选的近义词,水印便无处着力;校对人类文本或代码时,可做文章的随机选择点也很少。而「把每个词都重写一遍」的绕过策略是否真的可行、检测 API 上线后如何收费,仍是后续要观察的细节。

三、Nvidia 缩减 OpenAI 数据中心担保:2500 亿缩水至不足 1200 亿

据《华尔街日报》8月14日披露,因投资者对 Nvidia 巨额头寸风险的担忧加剧,Nvidia 已下调对 OpenAI 俄亥俄州数据中心项目的融资担保:初始担保额从此前讨论的 2500 亿美元降至不足 1200 亿美元,且仅覆盖项目一期,协议最早可能于当周周末签署。该项目由软银旗下 SB Energy 开发、装机 10 吉瓦,若建成将是迄今公布的最大数据中心项目。

耐人寻味的是,就在同一周,Nvidia 刚联合六家大型金融机构推出总额超 5000 亿美元的算力融资平台。此番主动缩担保,等于在「帮客户融资买自家芯片」的激进玩法上踩了一脚刹车。OpenAI 估值虽有 8520 亿美元但仍未盈利,这一调整也让「AI 基建的资本游戏究竟由谁兜底」成了悬而未决的问题。

这笔交易本是 7 月下旬流传的「2500 亿美元担保」计划的延续,如今被压缩为一期工程。一方面,投资者担忧 Nvidia 资产负债表上或有负债的规模过大;另一方面,华尔街对 OpenAI 盈利能力的审视也在同步升温——两股力量交汇,进一步坐实了本周榜单里的「资本冷却」信号。

四、OpenAI CFO 预告:2027 年上市,「IPO 只是里程碑」

8月19日全员工大会上,OpenAI CFO Sarah Friar 明确表示公司「将在 2027 年成为上市公司」,若业务持续加速甚至可能更早。她向员工强调「IPO 不是终点线,而是又一个融资里程碑」,并提醒不必在意对手 Anthropic 可能在九月抢先公开上市。此前 OpenAI 已于 6 月向 SEC 秘密提交招股书,3 月刚完成 1220 亿美元融资。

大会幻灯片给出的数据相当亮眼:营收运行率环比 +35%、企业营收 +50%,AI 编码产品的周活跃用户已达 2000 万,二季度营收 67 亿美元(环比 +18%)。不过公司正经历高管密集出走:营收负责人任职 8 个月即离场,多年老将 Lightcap 宣布离职,产品负责人 7 月卸任。而对手 Anthropic 年化营收已冲到 650 亿美元(同比 7 倍)——上市前的这场声量竞赛正变得更加白热化。

总裁 Greg Brockman 则对人事波动不以为意,称「OpenAI 之所以显得动荡,是因为一切都被放在聚光灯下」。对投资人而言,真正要权衡的是:高速增长的营收与层层加码的算力资本开支,能否在 2027 年上市前跑出健康的利润曲线——这恐怕才是决定上市定价的关键变量。

五、Asana 用 Codex 两周清理五年技术债:1.2 万美元对 600 万美元

OpenAI 8月18日发布官方案例:Asana 借助 Codex 在一个双周冲刺内完成了预计耗时五年、人力预算约 600 万美元的工程改造——彻底移除早已停止维护、阻碍前端技术栈现代化升级的旧测试框架 Enzyme。工程团队仅用一段五句话的提示词,让最多四个编码 Agent 各自在代码库的独立副本中并行作业,工程师每天检查两次进度并逐条审查改动。

最终模型与基础设施成本合计约 1.2 万美元,不到原计划预算的一个零头。CTO Amritansh Raghav 的点评很克制:并非所有多年项目都能压缩成数周,但 Agent 确实让过去「不可能的任务」变得值得一试。这个案例的意义在于——「用 Agent 重写存量代码」正式进入了企业级 ROI 验证阶段,也预示着更多沉睡已久的工程债将被重新评估。

结语

把本周的榜单连起来看,信号相当清晰:推理成本继续下行(Gemini 半价)、合规成为不可逆的强制变量(文本水印)、万亿级算力资本游戏开始降温(担保缩水)、头部实验室加速走向公开市场(OpenAI 与 Anthropic),而 Agent 对存量工程的改造正在用真实的生产力数据证明自己。下周,我们继续追踪这些变量的下一步走向。