8月21日,DeepSeek给V4-Flash补上了"眼睛":多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp上线并开放API,但仍是实验版本,用户需要在调用时手动指定模型名称(deepseek-v4-flash-vision-exp)才能访问。官方本次没有提及网页端和App的开放安排。
新模型可以读取截图中的文字、理解图表和页面布局,也能把图片与文字指令放在同一次任务中处理。这意味着智能体不必再让人"用文字描述图片"。对需要查看网页、分析界面、整理图文资料的Agent来说,这是一次能力补齐。
与Opus 4.8互有胜负
DeepSeek公布的对比数据显示,V4-Flash-Vision-Exp在多个Agent benchmark上与Anthropic的Claude Opus 4.8互有胜负:
与自家文本版DeepSeek V4-Flash-0731对比,视觉版在纯文本任务上基本持平,但在需要看图的多模态测试上大幅领先:ApexBench从26.2涨到36.5,Agents' Last Exam从25.2涨到27.3。视觉能力的加入并没有拖累原有的文本表现,这是这次实验版最关键的信号。
视觉不是用来"看图说话"
官方放出的三个演示都不是识图问答这种基础任务:一个是给高净值客户做西藏自驾游PPT,要求野性、粗粝、有实拍质感;一个是按黑蓝深海、玻璃UI、ASCII像素等视觉要素重构DeepSeek Harness官网;还有一个是做带黏土怪物动效的网页Demo。
三个案例的共同点是:模型要先看懂图片、页面结构和设计意图,再调用工具产出PPT或代码。DeepSeek想展示的不是"能看图",而是视觉能力嵌进完整的Agent工作流。
API与计费
API支持三种主流调用格式(Chat Completions、Messages、Responses),图片可以通过链接、Base64或先上传再引用的方式传入。图片会被转换成token计费,一张图最多折算384 tokens,与文字输入统一定价,整体价格与文本版V4-Flash保持一致。
同时上线的还有Files API:用户可以先把图片上传到平台,之后在多次请求中通过file_id复用,避免反复上传。这个接口本身不收费,但模型每次处理图片产生的token仍会正常计费。对需要重复分析同一批截图、图表的工作流来说,这个功能主要省的是带宽,不是推理成本。(易句)
(本文由AI撰文,网易编辑负责校对)