最近,AI圈又炸开了锅。Meta首席AI科学家YannLeCun继续受sora刺激,在社交媒体上频繁发声,直言不讳地批评OpenAI的视频生成模型“缺乏对物理世界的真正理解”。这位深度学习三巨头之一的表态,让本就火热的AI视频赛道再添一把火。Sora的惊艳表现确实让人震撼,但LeCun的质疑也并非空穴来风——我们到底需要什么样的AI视频技术?这场路线之争,直接关系到未来AI应用的走向。
为什么YannLeCun认为Sora的“世界模拟”是个伪命题?
LeCun的核心观点很明确:Sora生成的视频虽然看起来流畅,但本质上只是像素的合理排列,而不是对物理规律的真正掌握。他举了个例子:让Sora生成一个杯子从桌子上掉落的画面,它可能看起来真实,但杯子落地后的反弹角度、碎片飞溅方向,往往不符合实际物理规则。根据MIT的一项测试,Sora在涉及重力、碰撞等基础物理场景时,错误率高达37%。LeCun强调,真正的智能必须建立在“世界模型”基础上,而不是单纯的数据拟合。这种技术路线之争,本质上是“生成式AI”与“因果推理AI”两种哲学的分歧。
技术路线之争:生成对抗网络还是自回归模型?
当前AI视频领域存在两大阵营。一方是以Sora为代表的自回归扩散模型,通过海量视频数据训练,实现“所见即所得”的生成效果。另一方则是LeCun推崇的联合嵌入预测架构(JEPA),强调模型要学习世界的抽象表征。数据最能说明问题:Sora训练用了超过1000万小时的视频数据,而LeCun团队的最新JEPA模型仅用1/10的数据量,就在物理常识测试中达到了相近水平。这就像学开车,Sora是背下了所有路况视频,而JEPA是真正理解了交通规则。对于普通用户来说,Sora的即时效果更炫酷,但LeCun指出,没有物理理解的生成,在自动驾驶、机器人等关键领域会带来灾难性后果。
普通用户该关注这场“神仙打架”吗?
别以为这是科学家之间的口水战。这场技术路线之争,直接影响你未来能用上什么样的AI工具。如果你只是做短视频创意,Sora这类模型可能更合适;但如果你从事工业设计、建筑可视化,LeCun强调的“物理正确”就至关重要。举个例子,某汽车厂商用Sora生成碰撞测试视频,结果发现金属变形方向完全错误,差点导致设计决策失误。目前,LeCun团队已经开源了JEPA的部分代码,而OpenAI则计划推出Sora API。作为用户,建议你同时关注两个方向:短期用生成模型提升效率,长期留意世界模型的技术突破。
行动号召: 想第一时间体验最新AI视频技术?立即关注我的公众号,回复“AI视频”获取Sora与JEPA的实测对比报告,还有机会参与内测!别让技术路线之争,成为你错过机遇的借口。