作者:动察Beating
2026 年 8 月 21 日,DeepSeek 推出全新的视觉理解模型 deepseek-v4-flash-vision-exp,多模态 API 正式开放。开发者第一次可以把图片直接送进 DeepSeek 的官方接口。
模型保留了 V4 Flash 的 100 万 token 上下文和 38.4 万 token 最大输出,支持 JSON Output、Tool Calls、Responses API,也兼容 Anthropic API。
价格也完全沿用 V4 Flash。每百万 token 输入,缓存未命中时,高峰期 3 元,空闲期 1.5 元;缓存命中分别是 0.1 元和 0.05 元。输出高峰期 9 元,空闲期 4.5 元。北京每天 9 时至 12 时、14 时至 18 时属于高峰,其余 17 个小时半价。
图片同样按 token 结算。进入模型前,每张图片都会根据尺寸自动缩放,小于约 384×384 像素的会被放大,大图则会被压到约 800×800 像素的总像素量。单张图片最多占 384 个 token。一张 2000×2000 的图片和一张 5000×5000 的图片,最后可能花掉完全一样的 token。
按照 384 token 的上限,一张图片在高峰期、缓存未命中的输入费用约为 0.001152 元。处理一千张这样的图片,图片输入本身也只有约 1.152 元,文字和模型输出另算。
一起上线的还有 Files API。开发者可以提前上传图片,再把 file_id 放进请求。同一张图只需要传一次,之后可以在不同请求里反复引用。
这个 API 本身不收费。单个文件最大 64 MiB,每个用户最多存 25 GiB、10000 个文件。文件可以设置在 1 小时到 30 天后过期,不设置有效期则可以一直保留。目前官方也没有提供下载文件内容的接口。开发者可以上传、查询和删除,模型可以读取。它更像一个专门给推理准备的免费图片仓库,而不是普通云盘。
不过奇怪的其实不是 DeepSeek 到今天才会看图。
如果只看研究,DeepSeek 的视觉并不晚。
如果只看产品和 API,它又确实晚了很久。
2024 年 3 月 11 日,DeepSeek-VL 开源。
它有 1.3B 和 7B 两个版本,能看自然图片、网页、公式、图表和文档。到了 10 月,Janus 出现,把图像理解与生成放进同一套自回归框架。11 月 13 日,JanusFlow 跟进。12 月,DeepSeek-VL2 发布,换成混合专家架构,总参数量分成 3B、16B 和 27B 三档。

2025 年 1 月 28 日凌晨,除夕,Janus-Pro 开源。官方仓库按照 UTC 记在 1 月 27 日。
7B 版本在 GenEval 这项文字生成图片的指令遵循评测里拿到 0.80,超过论文所列 DALL-E 3 的 0.67。它有开源权重,可以本地部署,也有公开演示。
DeepSeek 没有把它接进自己的托管 API。
就在此前一周,R1 已经把 DeepSeek 推到了聚光灯下面。Janus 留在 GitHub 和 Hugging Face。对绝大多数普通用户来说,它很快又消失在了视野里。
2025 年 10 月 20 日,DeepSeek-OCR 开源,用视觉 token 压缩长文档。2026 年 1 月 27 日,OCR 2 发布。
从 DeepSeek-VL 开始算,两年里至少能查到 DeepSeek-VL、Janus、JanusFlow、VL2、Janus-Pro、OCR 和 OCR 2 七条公开记录。
视觉研究一直在做,也一直往外放。
只是普通开发者一直没有那个入口。
而另一边,到 2024 年 3 月,几家主要竞争对手的开发者接口都已经可以接收图片。OpenAI 在 2023 年 11 月开放 GPT-4 Turbo with Vision,图片可以直接进入 Chat Completions API;一个月后,Google 上线 Gemini Pro Vision API;2024 年 3 月,Claude 3 全系加入视觉能力。
2025 年 4 月 25 日,李彦宏在百度 Create 大会上说,「DeepSeek 也不是万能的」。随后列出的几个问题里,就有模态单一。
他的判断是,多模态会成为基础模型的标配,纯文本模型的市场会越来越小。
那时候,DeepSeek 已经做了一年视觉研究。
2026 年 4 月 7 日和 8 日,部分用户打开 DeepSeek,界面里突然多出三个入口。
「快速」「专家」「视觉」。

4 月 29 日,DeepSeek 多模态团队负责人陈小康确认识图功能开始面向部分用户灰度。随后,DeepSeek 一名资深研究员写道,「小鲸鱼现在能看见了」。南华早报直接把这句话放进了标题。
DeepSeek 的眼睛第一次真正从产品界面里露出来。
第二天,DeepSeek 把《Thinking with Visual Primitives》放上 GitHub。几个小时以后,仓库和论文又被撤下。到了 5 月 1 日,原地址已经返回 404。DeepSeek 没有解释,网上只剩下论文镜像和媒体转述。
论文研究的是一个很具体的问题。
模型看到一张很拥挤的图片以后,常常知道自己在说什么,却说不清自己说的究竟是哪一个人、哪一条线。团队把点坐标和边界框直接插进推理过程,让模型一边指出位置,一边继续往下想。
一张 756×756 的图片先经过视觉编码器,变成 2916 个图像块 token,再通过 3×3 空间压缩合成 324 个 token。V4 Flash 的稀疏注意力继续压缩缓存,最后只留下 81 个视觉 KV 条目。
团队还为这套方法生成了超过 4000 万条训练样本,其中包括专门训练迷宫导航和路径追踪的数据。
这篇论文花了很大力气解决的,其实是「指哪儿」。
模型先得看见,再得知道自己正在看哪里。只有这样,它才能继续往下推理。
DeepSeek 这次没有说明 Vision Exp 是否完整沿用了这套 Visual Primitives 方案。更重要的是,这项研究第一次把 DeepSeek 对「视觉推理」的理解暴露在了外面。
6 月 18 日,网页和 App 的识图模式正式上线。第二天,有媒体上传梁文锋的照片测试,DeepSeek 连续两次把他认成张一鸣。换一个对话,它又把张一鸣认成寒武纪创始人陈天石。
它已经能读英文截图,也能把网页转成代码。
到了人脸面前,却连自己老板都认不出来。
8 月 19 日,DeepSeek Harness 留下一份日期明确的技术说明。官方适配器已经能够把图片序列化成 image_url,文档同时写明,默认模型目录暂时不会展示 deepseek-v4-flash-vision-exp,需要等对应的 API 端点可用。
8 月 20 日,还有开发者实测发现,给这个尚未开放的模型名传图,只会收到 400 错误。
8 月 21 日,这个限制被拿掉。Harness 把 deepseek-v4-flash-vision-exp 加进默认模型目录,对应的合并提交直接写着「publish the vision model」。随后,DeepSeek 官方 API 文档和公众号同时宣布 Vision Exp 上线。
两条线终于碰到了一起。
在今年 5 月一场投资者交流会的录音转写里,梁文锋把自己理解中的 AGI 路线排成了几级台阶:语言模型、思维链、Agent、持续学习、自我迭代,再到具身智能。
多模态被他放在组件的位置,和搜索差不多。
谈到视频生成时,转写里有一句话:
在商业上,它是个好生意。但是这跟智能没有什么关系。
他的判断是,视频生成、世界模型在当前阶段和智能上限的关系没有那么大,眼前更要紧的是 AI 训练,以及训练之后的持续学习。
多模态不一样的地方在于,它虽然也被放在「组件」的位置,却是 DeepSeek 明确说过一定会做的组件。梁文锋当时还提到,V4 以及后续版本会支持原生多模态。
视觉在 DeepSeek 的路线里一直有位置,只是排得没有那么靠前。
等路线走到第三步 Agent,情况开始有些不一样了。
DeepSeek 没有公开说过,这次视觉 API 是「为了 Agent 才上线」。但把梁文锋对路线的判断和今天的发布放在一起,两条线已经很难完全分开看。
Agent 要读屏幕,要看图表,要处理工具扔回来的截图。它不可能永远生活在纯文本里。那些已经做了两年的视觉能力,也终于从论文、仓库和测试页面里,一路走到了 API。
DeepSeek 今天给 Vision Exp 展示的三个例子也都不是传统的「看图说话」:一个 Agent 给高端客户制作西藏自驾游 PPT,一个重新设计 DeepSeek Harness 官网,还有一个根据视觉要求制作带动态效果的前端 Demo。
它们都需要模型在长流程任务里反复处理视觉信息。
API 的设计也在往这个方向靠。Responses API 同样接受 input_image,浏览器 Agent 可以拿到网页截图以后,把它重新送进下一轮推理;代码 Agent 可以检查渲染结果,图表、扫描件和软件界面也能直接成为上下文。
Files API 则解决另一件事:同一张图不用在每轮请求里重复上传。一个文件可以长期放在那里,Agent 只需要反复传 file_id。单次请求最多还能放 600 张图片。使用外部链接或 Base64 时,单张图片上限是 32 MiB,通过 Files API 引用后可以到 64 MiB。
这已经不太像给聊天框加一个「上传图片」按钮。
它更像是在补 Agent 使用视觉时需要的基础设施。
DeepSeek 公布的四项多模态 Agent 对比,也很少在考传统意义上的「看图说话」。
ApexBench 关注投行、咨询和法律等长流程任务。Agents' Last Exam 来自 55 个专业领域的真实工作。Chartography 专门考 Kaplan-Meier 曲线、K 线、等高线、桑基图和波特图。ZeroBench 则用 100 道人工设计的难题测试多步视觉推理。

Vision Exp 对 Claude Opus 4.8 拿到两胜两负。
Agents' Last Exam 是 27.3 对 25.7,ZeroBench 是 35.0 对 34.0。ApexBench 为 36.5 对 39.4,Chartography 为 64.3 对 65.0。四项差距都没有超过 3 分。
更有意思的是,加上视觉以后,原来的文本 Agent 能力没有明显掉下去。
和 7 月 31 日发布的纯文本 V4 Flash 逐项比较,官网同时给出前后成绩的五项文本 Agent 评测全部上涨。
Terminal Bench 2.1 从 82.7 涨到 83.9,NL2Repo 从 54.2 到 57.7,DeepSWE 从 54.4 到 59.3,DSBench-Hard 从 59.6 到 63.6,AutomationBench 从 25.1 到 25.7。DeepSWE 的 59.3,也超过了图中 Opus 4.8 的 58.0。
不过,这组数字来自 DeepSeek 自己的测试。官方注明,公开 Code Agent 文本任务中的 DeepSeek 系列模型使用 DeepSeek Harness 极简模式,推理档位设为 max。它们更适合用来观察 Vision Exp 相比自家 V4 Flash 的变化,而不是直接当成第三方独立排名。
模型名字后面的 exp 也还没有摘掉。
DeepSeek 明确把它标成实验模型,版本仍然可能继续变化。现在的接口只做图片理解,输出依然是文字。图片生成和视频没有开放,Files API 也只接受 JPEG、PNG、GIF 和 WebP,PDF 不能直接塞进去。
2024 年,开发者想给 DeepSeek 发一张图片,官方 API 还接不住。
到 2026 年 8 月 21 日,这张图片终于进来了。
DeepSeek 的眼睛确实睁开得晚。
等它真正睁开的时候,前面的路已经不允许它继续闭着眼睛走了。
声明:本文由入驻金色财经的作者撰写,观点仅代表作者本人,绝不代表金色财经赞同其观点或证实其描述。
提示:投资有风险,入市须谨慎。本资讯不作为投资理财建议。
比推 Bitpush News
奥派老古
佐爷歪脖山
比推 Bitpush News
区块律动BlockBeats
