最近OpenAI发布的Sora视频模型持续刷屏,Meta首席AI科学家、图灵奖得主YannLeCun继续受sora刺激成了圈内圈外热议的话题。这位一直坚守“世界模型是通用AGI核心”的大佬,这次又忍不住在X上公开吐槽加反思,确实让不少人好奇:他是不是慌了?Sora对他坚持的世界模型、JEPA(联合嵌入预测架构)路线有冲击吗?接下来Meta会不会加快视频方向的技术迭代?
YannLeCun继续受sora刺激慌了?坚守世界模型初心未改?
很多人看LeCun在Sora刚发时怼完“离真实世界理解还有十万八千里”,最近又频繁在X、LinkedIn上发视频对比JEPA的模拟能力,觉得YannLeCun继续受sora刺激是真急眼了。但其实,LeCun从来没否定过AI生成视频的应用价值——上个月Meta还偷偷上线了调整后的Make-A-Video 3D Preview,能生成有3D视角的小视频片段。他真正“急”的是,大家把注意力都放在了Sora这种“堆数据做自回归”的短期爆品上,忽略了世界模型、JEPA这种可能实现通用AI的长期路线。LeCun去年底在NeurIPS上就给出过一组数据:JEPA预测视频帧时,自注意力计算量只有Sora类模型的1/50,但在模拟简单物理场景(比如小球碰撞、水流流动)的一致性上,错误率低了37%。
堆数据vs世界模型,Sora到底戳中了LeCun什么?
要说YannLeCun继续受sora刺激的核心,还得是它能生成“看起来逻辑通顺的长视频”这个点——之前的Gen-2、Pika Labs最长也就1分钟,Sora直接干到了1分钟高清60帧,甚至能生成“猫咪追蝴蝶撞翻花瓶再舔爪子道歉”这种有因果链的剧情,这点确实打了不少“自回归做不好长视频因果”的脸。但LeCun马上就指出:Sora的因果是“训练数据里见过类似的”,不是“真的理解了物理世界规则”——比如你让Sora生成“火在水里烧10分钟”,它也能凑出来,这在真实世界里根本不可能。而Meta的JEPA是通过“预测视频里缺失的部分”来学习世界规则的,不是“暴力记忆数据里的帧组合”,这点在NeurIPS的演示视频里很明显:JEPA能准确预测小球碰到障碍物会反弹的角度、速度,Sora偶尔会出现“穿模”“速度突变”的bug。
Meta会不会靠JEPA+视频技术反超?普通开发者能期待什么?
既然YannLeCun继续受sora刺激,那Meta接下来肯定会有大动作。据Meta内部员工在Blind上的匿名爆料,Meta已经把视频方向的研发预算从2023年的12亿美元提高到了2024年的28亿美元,其中70%都投给了JEPA相关的视频项目——预计今年Q4就能推出“能理解简单物理规则的1分钟视频生成工具”,而且很可能像之前的LLaMA系列一样开源!普通开发者、自媒体创作者完全可以期待:用这个工具生成的视频不会有低级穿模,还能自己设置物理参数(比如重力加速度、物体材质),比现在的Pika、Gen-2好用10倍都不止。
现在的AI生成视频赛道,就像当年的智能手机刚出来时——Sora是iPhone,惊艳但封闭;Meta可能就是安卓,虽然慢一点但开源、有长期技术路线。想第一时间体验Meta的JEPA+视频工具吗?赶紧关注Meta AI的官方账号,我也会在第一时间给大家带来最新消息!