DeepSeek 近日宣布推出一款实验性多模态视觉理解模型——DeepSeek-V4-Flash-Vision-Exp,现已正式上线其API平台。该模型在继承原有文本处理能力的基础上,通过引入视觉理解模块,实现了多模态交互的突破性进展。
据技术文档披露,新模型在文本处理领域保持了与V4-Flash正式版相当的性能表现,涵盖智能代理、逻辑推理、知识储备等核心能力。在涉及视觉理解的专项测试中,其多模态代理能力较前代提升显著,测试成绩已接近行业领先的Opus-4.8模型水平。开发者可通过指定参数"model='deepseek-v4-flash-vision-exp'"调用该模型API。
平台同步更新了计费规则与调用规范。图像处理采用token化计量方式,单张图片最高折算384个token,计费标准与文本模型保持一致。为优化传输效率,系统支持base64编码内联、外部URL引用及Files API三种图片传输方式,其中Files API作为新增服务允许用户预先上传图片资源,后续调用时仅需通过file_id引用,有效减少重复传输带来的带宽消耗。
官方演示案例展示了模型的实际应用场景:在智能代理框架下自动生成包含地理信息的西藏自驾游商业演示文稿;对官方网站进行创意重构设计;以及开发具有黏土动画风格的交互式前端组件。这些案例验证了模型在图文协同创作、视觉内容二次开发等领域的实用价值。
技术团队特别说明,Files API作为配套服务将长期免费提供,用户上传的图片资源存储在平台专用服务器,通过加密传输确保数据安全。该服务特别适用于需要多次调用相同视觉素材的场景,例如电商平台的商品展示系统或教育机构的课件制作平台。












