视频号
    标题 摘要 内容
    详情

    近日,DeepSeek 正式在 Hugging Face 发布 V4 家族首款实验性多模态模型DeepSeek‑V4‑Flash‑Vision‑Exp,采用 MIT 开源协议面向全球开发者开放权重与参考实现,开发者可自由下载、二次开发及商用落地。


    该模型基于 DeepSeek‑V4‑Flash 底座构建,在原有 MoE 混合专家架构之上新增视觉编码器与对齐模块,通过持续训练获得图像理解能力,可完成图片描述、截图文字识别、图表解析等任务,同时完整保留原有文本推理、代码与 Agent 智能体能力,文本任务性能不发生衰减。模型总参数 305B,推理单 Token 仅激活 13B 参数,兼顾大模型能力与推理效率,原生支持百万级上下文窗口,兼容 JPEG、PNG、GIF、WebP 等主流图像格式。


    本次开源交付内容完整,包含模型权重文件、Tokenizer 工具、Prompt Encoding 参考实现以及轻量化 PyTorch 推理代码,覆盖视觉编码器、Aligner、DFlash Attention、MoE 路由、Hyper‑Connections、DSpark 等全部核心模块,方便开发者快速完成本地部署、二次迭代与场景验证。据了解,该模型此前已于 8 月 21 日上线 DeepSeek API 平台,本次开源让多模态能力从云端接口走向私有化部署环境,让更多团队可以自主构建具备视觉感知的 AI 智能体应用。


    区别于传统侧重看图问答的多模态模型,该实验模型重点面向多模态 Agent 场景,擅长读取网页截图、软件界面、图表等视觉信息,结合工具调用完成复杂任务,在多项智能体评测中取得亮眼表现,多模态 Agent 能力达到行业第一梯队水平。


    官方提示该版本为实验版本,主要用于技术研究与场景探索,后续将持续迭代优化视觉理解精度、稳定性与实际落地表现。随着该模型开源,开发者社区已快速涌现量化版本,进一步降低硬件部署门槛,将推动多模态 Agent 技术生态加速发展。