
8月21日,DeepSeek把自家的大模型工具链升到了0.1.1-rc.1版本。这次更新最显眼的变化,是在原有V4Flash和V4Pro两个模型之外,多了一个叫V4Flash Vision-Exp的视觉模型体验版。
说白了,这个新版本让AI从“只看得懂文字”变成了“既看得懂文字、又看得懂图片”。
就在前一天,v0.1.0-rc.8版本已经悄悄打通了多模态能力。所谓多模态,就是AI不再局限于处理文字输入,图片也成了它能够理解的“语言”。具体到操作层面,用户可以直接把工作截图和需求描述一起发给系统,/goal、/plan这些指令就能同时处理图文混合的内容。
举个例子:以前你想让AI帮你做一个页面,得先花半天时间描述界面长什么样、按钮在什么位置、颜色大概是什么风格。现在不用了,直接截个图甩过去,加上一句“照这个风格做一个”,AI就能自己看图动手。
这套能力对开发者来说尤其方便。以前要在代码里处理图片识别,得单独调接口、写额外逻辑;现在工具链原生支持了图片请求,配置一下就能用,省去了不少中间环节。
有人可能会问:DeepSeek网页端不是早就能识图了吗?确实,但这次的意义不一样。网页端识图是借道第三方视觉模型临时实现的,而这次是DeepSeek自研的视觉模型直接集成进了开发工具链,属于“原装出厂”而非“后加配件”。V4Flash Vision-Exp的上线,等于把多模态处理的最后一块短板补齐了。
想体验的开发者也不用等什么内测资格,通过npm命令升级一下工具链版本就能上手试试这个新模型,速度和质量都值得期待。
从整个行业来看,视觉能力正在成为AI助手的标配。谁能让AI更懂“看见”,谁就能在下一轮竞争中占得先机。DeepSeek这一步走得不算早,但来得足够快——两天一个版本,看得出他们在这条赛道上踩紧了油门。