本周概览
过去一周,AI 圈的信息密度依旧惊人:谷歌在六周内连发三款 Flash 小模型,这次直接带上专门的"网络安全版";OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 上刷出 99.9% 的成绩并首次越过人类行动效率基线;有人用 1.7 万次真实会话摸清了 Claude Code、Codex 与 Cursor 的"选型口味";AI 安全公司 AISLE 在 curl 上打出 6:0 的比分;Hugging Face 则开源了一个让编码 Agent"过目不忘"的本地记忆层。从模型、基准、Agent 工程到安全与开源基础设施,五个方向都有新东西落地。
一、Gemini 3.8 Flash 与 3.8 Flash Cyber 发布:6 周内第三款 Flash
9 月 2 日,谷歌发布 Gemini 3.8 Flash 及其网络安全特供版 3.8 Flash Cyber,HN 热度 1146 分,是六周内第三款 Flash 模型,主打"更强能力 × 不变速度 × 低价":介绍价输入 0.75 美元、输出 3.75 美元每百万 token(2027 年起恢复 1.5/7.5 美元)。官方基准显示其软件工程能力(DeepSWE v1.1)超越多数更大的前沿模型,多步推理 HLE-Verified 得分 54.9%;"更努力地工作"的设计让它在复杂任务中执行额外推理步骤、迭代调用工具,同时允许开发者调低 effort 级别控制 token 开销。模型已通过 Google AI Studio 的 Gemini API(模型 ID gemini-3.8-flash)与 Gemini 应用向开发者开放,适合长周期编码任务与自主智能体规模化部署。
3.8 Flash Cyber 则面向防御者而非攻击者:内部 20 种语言漏洞发现基准成功率超 70%,CWE-Bench 自动修补 pass@1 达 47.2% 且处于成本 Pareto 前沿;Chrome 安全团队用它产出的正确补丁数量是最强商业模型的 2.6 倍,Wiz 渗透测试召回率提升 7.5%-9.7%,成本仅为其 1/2.3-1/5.2。该模型通过 Fairwind Program 定向提供给政府机构、关键基础设施运营商与软件维护者,有意弱化进攻性利用能力。
二、GPT-6 Astra 拿下 ARC-AGI-3:99.9% 与人类行动效率
ARC-AGI-3 是 François Chollet 团队推出的第三代交互式推理基准,通过探索、建模、目标设定与规划执行四个维度衡量智能体能力,环境仅含核心知识先验,人类可 100% 完成。9 月 3 日 ARC Prize 官方博客公布 OpenAI GPT-6 Astra 在 ARC-AGI-3 的成绩:标准无差别 harness 下 62.7%(约 2.6 万美元),换用保留推理状态的 Provider Adapter harness 后飙到 99.9%(约 1.9 万美元)。更值得注意的是行动效率:Astra 在 96% 的关卡中动作数少于人类中位数,平均每关少用 51.7% 的动作,这是该交互式基准推出以来 AI 首次系统性越过人类基线(对照组约 500 名普通人)。
ARC Prize 观察到 Astra 会把陌生环境内化成紧凑的符号化世界模型:自造代数简写记录对象坐标、机制与顺序计划(如 "extend8 to3; retract10 to2"),在 PRO-LONG 沙箱中还会为每款游戏现写 parser、搜索算法与小型库(如迷宫关的 maze_solver.py、巡逻建模的 patrol_solver.py)。官方强调 99.9% 不构成"AGI 证明",但承认这是前沿模型能力的一次阶跃,并宣布今后在排行榜上同时标注两种 harness 的结果。
三、1.7 万次会话实测:Claude Code、Codex 与 Cursor 的选型口味
Armature 团队 9 月 3 日公布迄今规模最大的编码 Agent 选型实验:16,893 次会话、75 个仓库、10 种语言、4 种 persona(vibe 程序员到企业工程师),三个 Agent 真刀真枪实现方案而非只给建议。实验由 Gemini 3.7 Flash 扮演"模拟人类"与判官:先让 Agent 分析代码库给出推荐再实施,避免"直接开干"诱导 Agent 全部自建方案的偏差。结论一:三者仅在 42% 的场景选中同一工具——语音 Agent 领域 Claude Code 选 Twilio、Codex 选 OpenAI Realtime API、Cursor 选 Vapi。结论二:信息源差异巨大,Codex 94% 会话走 web 搜索且九成带 site: 定向到信任域,Claude Code 更依赖先验知识、仅约 30% 场景联网,但一旦联网浏览页数是 Codex 的 3 倍。
结论三:被提及不等于被选中——LangChain 被提 194 次只被选 4 次,PayPal 被提 139 次零胜出(Stripe 赢走其中 124 次),Supabase 被提 242 次仍输给 Neon。结论四:仓库上下文与定价页写法能翻盘——同样的邮件需求在 TypeScript/Python/Go/Java 仓库分别选中 Resend/Sendgrid/Postmark/Azure ACS;Mailgun 常因免费档"1 天留存"字样输给 Postmark。对厂商而言,"被 Agent 选中"正成为新的增长渠道(Vercel 称超过 30% 的部署已由编码 Agent 发起)。
四、6:0!AISLE 在 curl 上发现 6 个零日,OpenAI 与 Anthropic 交白卷
curl 是部署最广的网络工具之一,官方口径覆盖全球超 200 亿实例。8 月 24 日,curl 创始人 Daniel Stenberg 公开表示,Anthropic Mythos 与 OpenAI Codex Security 对 curl 的分析均"找不到更多漏洞";次日,AI 安全公司 AISLE 的自研系统报出 29 个发现,其中 6 个被 curl 团队确认为 CVE 并在 8.22.0 版修复:OpenSSL provider use-after-free(CVE-2026-80229)、OpenSSL pinning 绕过(CVE-2026-80230)、CA store 连接复用(CVE-2026-80231)、tab 字符绕过 secure attribute(CVE-2026-80255)、wolfSSL CA 缓存覆盖回调(CVE-2026-82208)与域级 public-suffix cookie(CVE-2026-82209)。
六枚均为 Low 严重度,符合 curl 高度工程成熟度的画像——残存漏洞藏在窄配置与微妙交互里。curl 待处理 CVE 数量在 AISLE 报告后从 3 个升至 10 个,其中 6 个来自 AISLE。Linux 稳定版维护者 Greg Kroah-Hartman 回应称在 Linux 内核上看到同样现象。这次对比的特殊之处在于基线公开且带时间戳:不是 CTF 或已知答案基准,而是维护者亲自裁决的真实生产代码零日,为"专用 AI 系统 vs 前沿实验室通用系统"的路线之争提供了罕见实证。
五、Hugging Face 开源 Funes:让编码 Agent 拥有本地持久记忆
9 月 3 日 Hugging Face 开源 Funes——面向编码 Agent 的持久记忆层,支持 Claude Code、Codex、pi 与 Hermes 四款工具,把机器上已有的会话 trace 转成可检索记忆。一条 `funes add claude` 命令完成建索引、注入 recall/get 工具与安装自动钩子。底层是确定性管道(解析 trace → 分块 → 本地嵌入 → 写入 append-only 的 Lance 数据集),检索走"向量 + BM25 → 融合 → cross-encoder 重排 → 时间加权"的混合管线,全流程本地运行、凭据就地脱敏,单一二进制且无 ML 运行时依赖。
与主流 compaction(压缩摘要)方案不同,Funes 的 recall 返回原文段落并标注精确来源(代理、时间戳、会话、turn 号),作者基准显示 recall 比手写 handoff 便宜 8 倍与 4 倍,而 compaction 在两项任务中失败了一项——摘要压平了关键发现。记忆默认私有,也可绑定 HF Hub 数据集实现跨机同步与团队共享,团队场景下,新成员第一天就能检索团队数月会话沉淀的决策记录与死路探索,是对"Agent 会话即资产"的一次基础设施化尝试。
总结
本周主线清晰:模型层继续卷推理与安全特化,Agent 层开始被大规模实测解剖,AI 安全与记忆基础设施成为新的竞争焦点。对开发者而言,3.8 Flash 的低价长任务、ARC-AGI-3 的行动效率数据、Armature 公开的全量 traces 与 Funes 的本地记忆,都是可以立刻上手验证的东西。