一、是真想把Atlas讲明白
李飞飞这次,是真想把Atlas讲明白。
「全球*」多模态世界模型Atlas刚发布,她就拉上World Labs另外两位联创做客a16z,大聊特聊Atlas到底是什么、背后有哪些核心技术以及它到底意味着什么。
左起依次是:联创Justin Johnson和
Ben
Mildenhall、
李飞飞
、
主持人
Martin Casado
信息量很大,先给大家划个重点:
Atlas的基本动作,是换个位置继续看。
LLM预测下一个token,视频模型预测下一帧,Atlas预测的则是新视角。
给它几张照片,它要理解这些画面在空间里是什么关系,再告诉你从另一个位置看过去会是什么样。
李飞飞
看来,机器人眼下*的瓶颈是数据而非芯片。Atlas可以把真实环境更快搬进仿真世界,再通过随机化制造大量训练场景。
而最有野心的判断,还在最后。
他们把「新视角预测」和「下一个token预测」放在同一位置,认为它可能是通往AGI的基础原语。
这个判断能不能立住还得看后续模型,但如果你关心世界模型和空间智能将如何演化,这场对话值得一读。
以下为经整理后的全文实录。
1、Atlas是什么,为什么重要
主持人
:谁先介绍一下昨天发布了什么,以及它为什么重要?
Justin
:Atlas是我们新一代的世界模型,有三项基本能力:
2、生成、重建和模拟世界
。这三项之下,又有几种重要的具体能力。它非常擅长以相机为条件的生成。
你可以输入一张图像和一条相机运动轨迹,用它们控制模型,让模型沿着你想要的任何视角生成视频帧。
它也非常擅长稀疏3D重建。你可以输入一帧或多帧现实世界的图像,最多100帧,用这些不同视角重建现实世界;
重建的结果既可以是穿行于这个空间的视频,也可以是这个空间的显式3D重建。
最后它还可以用来做模拟。我们展示了一些很棒的子弹时间视频,在网上引起了很多关注,也展示了机器人仿真。
主持人
:什么是子弹时间视频?
Justin
:这个说法来自《黑客帝国》。*部电影里有个著名镜头,Neo向后倒下,你记得吧?
那一幕是慢动作,相机围着他绕了一整圈。为了拍出这个镜头,他们把数百台相机围成一圈。
Neo在摄影棚里向后倒下,数百台相机在绿幕前从不同角度拍摄,再把所有相机的画面组合起来,做成电影里的那个经典镜头。
。不需要摄影棚,不需要绿幕,也不需要昂贵的标定;我们真的可以把三部iPhone分别架在三脚架上就开始拍摄。
拍的可以是一个人投篮,也可以是一颗草莓落进一碗牛奶里。
拿到这三段iPhone视频以后,我们就能重新设计镜头:比如把时间冻结,让相机在牛奶溅起的瞬间飞进场景,得到非常惊艳的凝固时间画面。
这些只用几台相机就能做到。
主持人
:能不能用最简单的方式解释一下Atlas到底做什么?输入是什么,输出又是什么?
Justin
二、新视角预测主持人
新视角预测
主持人
:
Ben
,现在视频模型多得数不过来,大家都说自己是世界模型,也都声称能生成新视角。你能不能更具体地拆解一下,它和之前形形色色的模型到底有什么不同?
Ben
但Atlas的关键在于,输入的每一帧都有明确的空间意义
。它不只是一张让模型随意理解的图像,你也不必在文字提示里反复跟它较劲,试图让它按某个特定方式去做。
在Atlas里,每张图像都关联一个三维相机位姿。这意味着,你可以以极高的精度完成重建任务。
这与视频模型很不一样。
后者通常只有更高层的文字控制,你得反复重新生成,体验更像是玩老虎机
。
1、
放大的视频模型,还是新架构
主持人
Justin
Ben
现在有了Atlas,我们*次把视觉智能的这两个部分放进同一个模型
主持人
Justin
李飞飞
2、Ben:说的内容,都特别重要,
但大家对它们的重视还不够
主持人
李飞飞
最终它一定是4D,因为还有时间维度
主持人
其他人
:两年半。
主持人
李飞飞
Justin
但Marble和Atlas之间*的区别之一,就是输出模态
主持人
:
Ben
Ben
主持人
Ben
。
李飞飞
Ben
Ben
Justin
三、哪怕在这间屋子里
1、Ben:哪怕在这间屋子里,让
Ben
这就是为什么模型还需要生成这种机制,因为你永远不可能把所有东西都拍全
Ben
但在图像和视频模型这边,还没有人以同样系统的方式去推动这件事
。
。
主持人
Ben
主持人
Ben
生成的过程中,你想通过交互往上下文里加入哪些内容,可以自己选择
。
主持人
Justin
2、你们一开始就知道它会成功吗
主持人
李飞飞
。
Justin
主持人
Justin
李飞飞
经常强调的,数据非常重要;但任何事情都会有瓶颈,
而我认为,继续扩大这个模型的主要瓶颈,实际上是训练算力
。
李飞飞
Ben
Ben
主持人
3、李飞飞:3、应用场景,创意、游戏与机器人
主持人
:
Ben
,能不能具体讲讲应用场景?
4、Ben:比如建筑设计和施工
。
主持人
李飞飞
,你们收购了一家机器人公司。
李飞飞
为了做训练,这家公司,也就是我们现在的机器人团队,过去做的正是
5、Ben:四、*的问题也许会是芯片
有一天,*的问题也许会是芯片,但现在是数据
还有一个非常重要的步骤,叫随机化
完全可以想象,下一步是让它接收动态数据
主持人
:你刚才是不是也想说点什么?
Justin
非常关键的一点是:
在训练期间,这些策略必须接触到部署时可能出错的各种情况
但还有另一条路线,就是更加数据驱动的仿真
那么,为什么不能让模拟器本身成为规划器呢?
主持人
Justin
李飞飞
:对,波浪,水面的波浪。
Justin
主持人
Justin
我们后来意识到,即使最终想要的是静态输出,得到它的*办法,实际上也是让模型接触动态
6、我们能走进4D视频吗
主持人
:那么
Ben
李飞飞
:你看他们脸上的笑容就知道了。
主持人
Ben
李飞飞
Ben
这才是最终目标:
获得构建这种系统所需要的全部能力
。
主持人
李飞飞
Ben
刚才说的事情。
Justin
主持人
Justin
但我们逐渐意识到,
Ben
李飞飞
主持人
完整回看地址:
https://www.youtube.com/watch?v=qn1QDDBnTA0

远见网
