引言:一只眼睛引发的 483 分热帖
2026 年 8 月 21 日,DeepSeek 在官方 API 文档站悄然上线了一个实验模型:deepseek-v4-flash-vision-exp。没有任何发布会,没有铺天盖地的 PR,却在 Hacker News 上拿到了 483 个赞,登上当日热榜。评论区一片玩梗:“恭喜 DeepSeek 终于长出了眼睛,黑暗的日子要结束了”。
这个模型的特殊性不在于“能看图”本身——Claude 和 GPT 早就支持——而在于它来自一家曾公开宣称“纯文本就足够实现 AGI”的公司。当信仰与现实碰撞,DeepSeek 给出了一个非常务实的答案:文本能力一分不动,把视觉补成 agent 工作流的最后一块拼图。
从“纯文本信仰”到多模态:一次务实的战略转身
DeepSeek 创始人此前多次在公开场合表达过一个观点:语言本身已经包含了世界的大部分结构,多模态不是通往 AGI 的必经之路。这一立场曾让不少开发者坚信 DeepSeek 永远不会做视觉模型。然而 V4-Flash 0731 版本在实际使用中暴露了一个尴尬问题:模型经常“幻觉”自己拥有视觉能力,然后编造出“文本图像分析工具”去假装看图——有用户吐槽,必须反复叮嘱它不要读取截图,否则会话会被它自己搞崩。
社区把这种现象称为“模态幻觉”:当模型的文本世界知识里塞满了“图片长什么样”的描述,却没有任何真实的视觉通道时,它就只能表演。Vision-Exp 的发布正是对这个问题最直接的回应——与其让模型假装看见,不如真的给它一双眼睛。这也解释了为什么 HN 上热度最高的一条评论是“希望它能看清 Playwright 的截图”:对 agent 开发者而言,视觉缺失一直是 DeepSeek 系模型在自动化场景里的最大痛点。
deepseek-v4-flash-vision-exp:定位与能力基线
从官方新闻公告来看,这是一个“实验性多模态模型”:文本能力与 V4-Flash 完全持平,包括 agent 能力、推理和世界知识;在多模态 agent 基准测试上则大幅超越 V4-Flash,整体表现“接近 Opus-4.8”。换句话说,DeepSeek 没有重新训练一个全能模型,而是在既有文本主干上叠加了视觉编码器,把多模态能力作为一种增量供给。
这个定位非常聪明:文本主干的成熟度决定了模型不会因为加视觉而智力倒退,视觉编码器则负责把图像内容翻译成模型已经理解的 Token 序列。同步发布的还有 DeepSeek Harness 0.1.1——官方评测框架,开箱即用地支持新模型,方便开发者复现其基准成绩。
图片如何变成 Token:Vision Tokenizer 的计费魔法
Vision-Exp 最值得玩味的工程细节,是它的图片计费方式:官方文档明确写道,“图片按尺寸换算成 Token,与文本 Token 合并计费,每张最多 384 个 Token,价格按 V4-Flash 标准”。这是一个与 OpenAI、Anthropic 完全不同的计费范式——后两者按图片分辨率档位(low/high)或固定单价收费,而 DeepSeek 把图片“数字化”成了与文本同构的计费单元。
关键机制是推理前的自动缩放:总像素数低于约 384×384 的图片会被等比放大;更大的图片则等比缩小,使总像素数大致落在 800×800 图像的水平。缩放之后,图片被 tokenizer 切成视觉 patch,每个 patch 映射为若干 Token——单张图片的 Token 开销因此存在一个硬上限 384,直接绑定了推理成本。对开发者来说,这意味着“看一张图”的价格透明且可预期,与多写 384 个字没有区别。
800×800:分辨率取舍背后的推理经济学
800×800 的等效分辨率大约只有 64 万像素,HN 上有评论尖锐地指出:这比 1995 年 Super VGA 显示器的 79 万像素还低,要读懂一整页 A4 文档上的小字几乎不可能,OCR 类应用会明显受限。这确实是 Vision-Exp 眼下最大的短板——视觉细节被砍掉,换取的是推理速度和成本的可控。
这背后是典型的推理经济学取舍:视觉 patch 越多,prefill 阶段的 KV Cache 和 attention 计算量越大。DeepSeek 的一贯策略是用相对保守的输入分辨率换取 Flash 级别的高吞吐与低价,把“看得清”留给未来可能的高分辨率版本。对于聊天场景、图表概要、页面截图这类主体信息在宏观结构的任务,800×800 已经够用;但需要精确识别小字体的场景,仍需等待后续迭代。
Files API:一次上传,多次引用
与 Vision-Exp 同步上线的还有 Files API:把图片上传一次获得 file_id,之后可以在多个请求中反复引用,无需重复上传。官方强调它完全免费,主要价值在于节省请求带宽——尤其适合 agent 工作流中同一张截图被多个子任务轮询分析的场景。配合 48 MiB 的请求体限制,长文档截图直接 base64 内联会迅速撑爆请求体,Files API 就成了解药。
代码实战:三种方式把图片交给 DeepSeek
API 完全兼容 OpenAI Chat Completions 格式,支持 Chat Completions、Messages 与 Responses 三种接口。第一种方式是 base64 内联:本地文件经 base64 编码后作为 data URL 塞进 content 数组,适合单次请求。第二种是外部 URL:直接传一个公网可访问的 http(s) 链接,模型自行下载,但 URL 最长 8192 字符、图片最大 32 MiB、下载必须 60 秒内完成。第三种就是 Files API,先上传拿 file_id 再引用,适合多轮复用。三种方式的 content 数组结构完全一致,只是 image_url 的 url 字段值不同。
以 Python 为例,把一张本地截图交给模型只需要十几行代码:构造 OpenAI client、设置 base_url 为 https://api.deepseek.com、用 open() 读取图片并做 base64 编码,再把 \"data:image/jpeg;base64,...\" 作为 image_url 传入 messages,最后调用 chat.completions.create 指定 model=deepseek-v4-flash-vision-exp。这张图就会以最多 384 个 Token 的代价,变成模型上下文里真实存在的视觉信息。
写在最后:多模态对 agent 工作流的真实意义
Vision-Exp 的发布让 DeepSeek 的 agent 生态第一次有了完整的“感官”:浏览器自动化可以真正“看”截图而不必解析 DOM,文档处理可以直接理解图表而不用依赖 OCR 文本,多模态 agent 基准接近 Opus-4.8 的成绩则意味着这些能力不是摆设。对独立开发者来说,DeepSeek 的价格优势 + 图片 Token 化计费,让“看得懂图的 Agent”第一次成为低成本基础设施。
当然,800×800 的分辨率上限、实验模型的稳定性风险、开放权重与否的悬念,都是它需要回答的后续问题。但无论如何,“纯文本 AGI”的叙事已经翻篇——这家公司用一期实验模型证明,补票多模态并不需要背叛自己的推理优势,只需把视觉变成另一种 Token。