
你有没有想过,眼前这张平平无奇的旅游照片,能瞬间变成一段可以自由拖拽视角、绕到建筑背后看个究竟的电影级视频?李飞飞创始的World Labs刚发布了全球首个多模态世界模型Atlas,把这件事变成了现实。简单说,它能把一张或几张静态图片,变成一段最长1分钟、清晰度高达1440p的动态视频,甚至还能让你随意“飞”进去,换个角度欣赏场景里任何一个角落。
这背后最厉害的技术,就像一个拥有上帝视角的导演。以前的AI生成视频,大多只能按照它自己的“脾气”随意发挥,你很难说清“把镜头往左边转30度”。而Atlas能精确到像素级别,你想让镜头停在哪个位置、看向哪个角度,它都能一丝不苟地执行。《黑客帝国》里那颗子弹定格、镜头环绕主角旋转的经典镜头,过去需要几十台摄影机围成一圈才能拍出来。现在有了Atlas,只需要告诉它“我想要这个视角”,它就能用计算的方式,把这个效果完整地生成出来。
除了当“导演”,Atlas还有一双“透视眼”。你给它几十张不同角度的普通照片,它能把这些照片拼成一个完整的3D立体空间,就好像你用游戏引擎建了一个可以自由行走的虚拟场景。更难得的是,它不仅能还原看得见的地方,还能“脑补”出被遮挡、看不见的部分,让你从全新视角看到照片背后的空间结构。官方数据显示,在3D重建这个活儿上,Atlas已经跑赢了许多顶级的开源重建模型。
在模拟能力上,Atlas也展现出了它的“野心”。它能拿一段普通的视频做输入,理解画面里人和物体在空间里是怎么随时间移动的,然后重新构图、调整机位,让原本平淡的画面充满戏剧性。这种能力甚至延伸到了机器人领域——未来的机器人或许能在虚拟空间里先用Atlas“练手”,再走进真实世界。
当然,对普通用户来说,最直接的吸引点或许在于:它还支持纯文字描述直接生成图像和360度全景图。不管是复杂的提示词、画面里的文字,还是你想要的某种独特风格,它都能稳稳接住。
目前,Atlas已经向部分合作伙伴开放了抢先体验名额。用李飞飞的话说,他们想做的不是又一个会聊天的AI,而是让AI真正拥有理解世界、模拟世界、生成世界的能力。当AI不再局限于文字对话,而是变成懂空间、懂运动、懂物理规律的“世界模拟器”,下一场技术变革的序幕,或许已经悄然拉开。