您的位置:首页 >报道 >

卓驭ZYT-World:为移动物理AI搭建“训练舱”

2026-09-24 14:43:39来源:搜狐

鬼探头、盲区窜出的电瓶车、前车毫无征兆的急刹——这些让智驾系统最头疼的场景,在真实道路上属于“黑天鹅”,等一年碰不上一次,碰上一次可能就是终局。高频驾驶可以靠路采慢慢攒,但安全的上限,从来由那些“等不到、试不起”的低频高风险事件决定。

卓驭的选择是:不在现实里赌,给AI造一个平行世界。

这就是ZYT-World。它不是一段好看的视频,也不是一个演示品,而是卓驭为移动物理AI搭建的“训练舱”。

为什么需要世界模型,而不是3D重建?

在ZYT-World之前,行业更熟悉的路子是重建——把真实道路扫成3D模型再渲染。这条路精确,但有个致命短板:只能复刻,不能加戏。扫描那天路边停了5辆车,就只有5辆车;想加一个横穿的行人,做不了。更麻烦的是,每条路都得重新扫。

世界模型走的是另一条路。它不扫描,而是从海量真实驾驶视频中学会世界怎么运转。所以它的长处恰恰是重建的死穴:能想象。没发生过的事故可以生成,红绿灯可以改,旁车可以加塞——这种“反事实”场景,恰恰是评测和训练最缺的长尾。

但纯靠脑补有一个毛病:编过头。第二次路过同一个路口,路牌可能换了颜色。

所以ZYT-World的思路很清晰:生成负责想象,记忆负责认路。

四个字说清它的厉害:真、控、记、快

真:多目异构,一起脑补。

量产车的摄像头从来不是一种。有视场角超过180°的鱼眼,也有针孔,画幅从5:1到5:4五花八门。很多方案的做法是先把它们“翻译”成一种标准镜头再生成,结果出来的画面“像”,但不像你车上那组眼睛。

ZYT-World原生同时生成所有视角,鱼眼是鱼眼、针孔是针孔,而且严格对齐同一物理时刻——前视里那辆白车,侧鱼眼里也在该在的位置。每路约720P,两张GPU跑到4帧/秒,每帧只需1步去噪。

控:三层可控,干预可测。

控自车:同一起点,掉头和刹停是两个世界。控他车:前车急刹、旁车加塞、电瓶车从盲区窜出。控道路环境:直路改岔路、绿灯提前变红。一次只动一个变量,AI司机哪里不行,一测就知道。

相机也能换。同一段乘用车数据,换一套相机位置和参数重新生成,就成了重卡、物流大小车视角的数据。

记:记忆回溯,老路重逢。

这是ZYT-World最独特的地方。当车辆沿另一条轨迹重新驶入去过的路段,记忆模块会翻出“历史观测”,把路牌、路边停着的车这些不会走路的东西找回来,而不是随机再编一个。

这意味着什么?意味着同一个场景下,两条独立轨迹的生成完全对齐。你可以在同一个路口试一百种不同的走法,而路边的环境始终一致。这是闭环仿真的前提。

快:两张卡,实时长跑。

40步压到1步,再配整套推理加速。生成器比40步老师快107.7倍,解码器快59.8倍。有界KV-cache让显存不随时间增长,训练只见过8秒的片段,却能连续跑30秒以上,车道、建筑、光照依然稳定。

从“平行世界”到“训练舱”:卓驭的野心不止于智驾

到这里,ZYT-World作为“平行世界”的能力已经说清楚了。但“训练舱”这个身份,才是理解它真正意义的钥匙。

2025年12月30日,卓驭品牌盛典上,CEO沈劭劼用一场题为《行者》的演讲,宣布“数据驱动的空间智能移动基座”正式成型。他的判断很明确:“智能驾驶只是物理AI的初始形态,绝非终局,未来存活下来的智驾公司都将转型为移动物理AI公司”。

ZYT-World就是这条路径上的关键基础设施。它已经在三条线上跑起来了:

往下,给量产原生多模态基础模型做闭环仿真评测和长尾数据合成,每次模型发版贡献超20万场景闭环用例;往上,作为原生多模态基础模型的实时训练场,让模型在平行世界里学会因果理解和反事实推理;往外,用相机控制能力把已有数据拓展到商用重卡、物流车等多种构型平台。

这背后是卓驭从“大疆车载”到独立公司的一段硬仗。2024年9月27日,卓驭正式从大疆独立,面对财务压力和行业低毛利,做出了一个破釜沉舟的决定:全删原有代码库,全面转向端到端。

到今天,卓驭在乘用车领域已覆盖9大客户15大品牌,量产车型超50款。在商用车领域,与中国重卡TOP 6品牌全部建立合作,高速NOA解决方案将于今年下半年陆续量产上市。而无人物流车与Robotaxi项目也已明确试运营时间表。

ZYT-World不是宣称仿真已经替代路测。它给的是一条路径:把“最贵”、也“最危险”的那一课,先在平行世界里上完。

现实不给第二次机会。训练舱可以。

多目全知,逐帧实时,万物可控,生成想象,记忆认路。