李飞飞新访谈:LLM预测Token,世界模型预测「新视角」

一、是真想把Atlas讲明白

李飞飞这次,是真想把Atlas讲明白。

「全球*」多模态世界模型Atlas刚发布,她就拉上World Labs另外两位联创做客a16z,大聊特聊Atlas到底是什么、背后有哪些核心技术以及它到底意味着什么。

左起依次是:联创Justin Johnson和

Ben

Mildenhall、

李飞飞

主持人

Martin Casado

信息量很大,先给大家划个重点:

Atlas的基本动作,是换个位置继续看。

LLM预测下一个token,视频模型预测下一帧,Atlas预测的则是新视角。

给它几张照片,它要理解这些画面在空间里是什么关系,再告诉你从另一个位置看过去会是什么样。

李飞飞

看来,机器人眼下*的瓶颈是数据而非芯片。Atlas可以把真实环境更快搬进仿真世界,再通过随机化制造大量训练场景。

而最有野心的判断,还在最后。

他们把「新视角预测」和「下一个token预测」放在同一位置,认为它可能是通往AGI的基础原语。

这个判断能不能立住还得看后续模型,但如果你关心世界模型和空间智能将如何演化,这场对话值得一读。

以下为经整理后的全文实录。

1、Atlas是什么,为什么重要

主持人

:谁先介绍一下昨天发布了什么,以及它为什么重要?

Justin

:Atlas是我们新一代的世界模型,有三项基本能力:

2、生成、重建和模拟世界

。这三项之下,又有几种重要的具体能力。它非常擅长以相机为条件的生成。

你可以输入一张图像和一条相机运动轨迹,用它们控制模型,让模型沿着你想要的任何视角生成视频帧。

它也非常擅长稀疏3D重建。你可以输入一帧或多帧现实世界的图像,最多100帧,用这些不同视角重建现实世界;

重建的结果既可以是穿行于这个空间的视频,也可以是这个空间的显式3D重建。

最后它还可以用来做模拟。我们展示了一些很棒的子弹时间视频,在网上引起了很多关注,也展示了机器人仿真。

主持人

:什么是子弹时间视频?

Justin

:这个说法来自《黑客帝国》。*部电影里有个著名镜头,Neo向后倒下,你记得吧?

那一幕是慢动作,相机围着他绕了一整圈。为了拍出这个镜头,他们把数百台相机围成一圈。

Neo在摄影棚里向后倒下,数百台相机在绿幕前从不同角度拍摄,再把所有相机的画面组合起来,做成电影里的那个经典镜头。

。不需要摄影棚,不需要绿幕,也不需要昂贵的标定;我们真的可以把三部iPhone分别架在三脚架上就开始拍摄。

拍的可以是一个人投篮,也可以是一颗草莓落进一碗牛奶里。

拿到这三段iPhone视频以后,我们就能重新设计镜头:比如把时间冻结,让相机在牛奶溅起的瞬间飞进场景,得到非常惊艳的凝固时间画面。

这些只用几台相机就能做到。

主持人

:能不能用最简单的方式解释一下Atlas到底做什么?输入是什么,输出又是什么?

Justin

二、新视角预测主持人

新视角预测

主持人

Ben

,现在视频模型多得数不过来,大家都说自己是世界模型,也都声称能生成新视角。你能不能更具体地拆解一下,它和之前形形色色的模型到底有什么不同?

Ben

但Atlas的关键在于,输入的每一帧都有明确的空间意义

。它不只是一张让模型随意理解的图像,你也不必在文字提示里反复跟它较劲,试图让它按某个特定方式去做。

在Atlas里,每张图像都关联一个三维相机位姿。这意味着,你可以以极高的精度完成重建任务。

这与视频模型很不一样。

后者通常只有更高层的文字控制,你得反复重新生成,体验更像是玩老虎机

1、

放大的视频模型,还是新架构

主持人

Justin

Ben

现在有了Atlas,我们*次把视觉智能的这两个部分放进同一个模型

主持人

Justin

李飞飞

2、Ben:说的内容,都特别重要,

但大家对它们的重视还不够

主持人

李飞飞

最终它一定是4D,因为还有时间维度

主持人

其他人

:两年半。

主持人

李飞飞

Justin

但Marble和Atlas之间*的区别之一,就是输出模态

主持人

Ben

Ben

主持人

Ben

李飞飞

Ben

Ben

Justin

三、哪怕在这间屋子里

1、Ben:哪怕在这间屋子里,让

Ben

这就是为什么模型还需要生成这种机制,因为你永远不可能把所有东西都拍全

Ben

但在图像和视频模型这边,还没有人以同样系统的方式去推动这件事

主持人

Ben

主持人

Ben

生成的过程中,你想通过交互往上下文里加入哪些内容,可以自己选择

主持人

Justin

2、你们一开始就知道它会成功吗

主持人

李飞飞

Justin

主持人

Justin

李飞飞

经常强调的,数据非常重要;但任何事情都会有瓶颈,

而我认为,继续扩大这个模型的主要瓶颈,实际上是训练算力

李飞飞

Ben

Ben

主持人

3、李飞飞:3、应用场景,创意、游戏与机器人

主持人

Ben

,能不能具体讲讲应用场景?

4、Ben:比如建筑设计和施工

主持人

李飞飞

,你们收购了一家机器人公司。

李飞飞

为了做训练,这家公司,也就是我们现在的机器人团队,过去做的正是

5、Ben:四、*的问题也许会是芯片

有一天,*的问题也许会是芯片,但现在是数据

还有一个非常重要的步骤,叫随机化

完全可以想象,下一步是让它接收动态数据

主持人

:你刚才是不是也想说点什么?

Justin

非常关键的一点是:

在训练期间,这些策略必须接触到部署时可能出错的各种情况

但还有另一条路线,就是更加数据驱动的仿真

那么,为什么不能让模拟器本身成为规划器呢?

主持人

Justin

李飞飞

:对,波浪,水面的波浪。

Justin

主持人

Justin

我们后来意识到,即使最终想要的是静态输出,得到它的*办法,实际上也是让模型接触动态

6、我们能走进4D视频吗

主持人

:那么

Ben

李飞飞

:你看他们脸上的笑容就知道了。

主持人

Ben

李飞飞

Ben

这才是最终目标:

获得构建这种系统所需要的全部能力

主持人

李飞飞

Ben

刚才说的事情。

Justin

主持人

Justin

但我们逐渐意识到,

Ben

李飞飞

主持人

完整回看地址:

https://www.youtube.com/watch?v=qn1QDDBnTA0

来源: 投资界-首发
产业标签 半导体长征
赞(1) 支持本站
分享到

支持本站持续更新

如果这篇内容对你有帮助,欢迎扫码支持。

支付宝扫一扫

微信扫一扫

登录

找回密码

注册