谁在给智驾造平行世界?卓驭ZYT-World首次解密
摘要:如果鬼探头能重来一万次,自动驾驶还会怕它吗? 现实世界最残酷的地方在于:它没有补考。鬼探头、恶意加塞、盲区里突然窜出的电瓶车——这些最要命的场景,真实路…
如果鬼探头能重来一万次,自动驾驶还会怕它吗?
现实世界最残酷的地方在于:它没有补考。鬼探头、恶意加塞、盲区里突然窜出的电瓶车——这些最要命的场景,真实路上等一年未必碰上一次;碰上一次,代价可能就是终局。
高频驾驶可以靠路采慢慢攒,但安全的上限,从来由那些“等不到、试不起”的低频高风险事件决定。
所以,物理AI需要一个平行世界:可控、可重复、可归因,让极端场景被无限预演。ZYT-World,就是卓驭造出的这台“平行世界引擎”。

它不是一段好看的视频,也不是一个演示品。它已经落在卓驭三条技术线上:
往下,给量产原生多模态基础模型做强化学习和仿真评测,每次模型发版贡献超20万场景闭环用例;
往上,作为原生多模态基础模型的实时训练场,让模型在平行世界里学会因果理解和反事实推理;
往外,用特有的相机控制能力,把已有数据拓展到商用重卡、物流车等多种构型平台。
一、先把三个词说清楚:世界模型、强化学习、闭环仿真
世界模型,说白了就是“脑补下一秒”。人开车时,看到前车刹车灯亮,不用等它真停下,已经预判到接下来会发生什么。AI的世界模型,就是从海量真实驾驶视频里学会车怎么动、光怎么变、路口长什么样;给它一个起点和一串指令,它就能实时推演出多路摄像头接下来会看到的画面。
强化学习,是一种试错学习。不给标准答案,只给奖惩。做对了加分,撞了扣分,让AI在环境里反复试,自己试出一套高分策略。AlphaGo就是这么自己跟自己下了几百万盘练出来的。它最吃的资源是“环境”——下棋的环境是规则,不要钱;开车的环境是整个世界,真车撞一次代价太大。
闭环仿真,则是把方向盘插上电。传统自动驾驶测试是“开环”:看录像、握一个不插电的方向盘,AI说“我会打左”,却永远验证不了打了左之后会怎样。闭环世界里,AI打左,世界真往左,新画面再喂回AI。它既是考场,也是训练场。
闭环逼着世界模型同时做到四件事:真实、可控、反应快、记得住。ZYT-World要做的,就是同时过关。
二、为什么是“脑补”,而不是“拍3D照”
NeRF、3D Gaussian Splatting这类重建技术,是把真实道路扫成3D模型再渲染。几何精确,但只能复刻,不能想象:扫描那天有5辆车,就只有5辆车;想加一个横穿行人,做不了;每条路还得重扫。
世界模型不扫描,而是学习世界怎么运转。它的长处,正是重建的死穴——能想象。没发生过的事故可以生成,红绿灯可以改,旁车可以加塞。这种“反事实”场景,恰恰是评测和训练最缺的长尾。
但纯脑补也有毛病:容易编过头。第二次路过同一路口,路牌可能换了颜色。
所以ZYT-World的思路是:生成负责想象,再插一个“记忆”插件负责认路。
三、ZYT-World能干什么?四个字:真、控、记、快
真:多目异构,一起脑补。
量产车的摄像头不止一种:既有视场角超180°的鱼眼,也有针孔,画幅从5:1到5:4五花八门。很多方案先把它们“翻译”成一种标准镜头再生成,结果是像,但不像你车上那组眼睛。ZYT-World原生同时生成所有视角,鱼眼是鱼眼、针孔是针孔,并严格对齐同一物理时刻:前视里那辆白车,侧鱼眼里也在该在的位置。每路约720P,2张GPU跑到4帧/秒,每帧只需1步去噪;训练只见过8秒片段,却能连贯跑1分钟以上。
控:三层可控,干预可测。
控自车:同一起点,掉头和刹停是两个世界。控他车:前车急刹、旁车加塞、电瓶车从盲区窜出。控道路环境:直路改岔路、绿灯提前变红。一次只动一个变量,AI司机哪里不行,一测就知道。相机也能换:同一段乘用车数据,换一套相机位置和参数重新生成,就成了重卡、物流大小车视角的数据。
记:记忆回溯,老路重逢。
当车辆沿另一条轨迹重新驶入去过的路段,记忆模块会翻出“历史观测”,把路牌、路边停着的车这些不会走路的东西找回来,而不是随机再编一个。同一场景下两条独立轨迹的生成因此完全对齐。
快:两张卡,实时长跑。
40步压到1步,再配整套推理加速:生成器比40步老师快107.7倍,解码器快59.8倍、显存省约27倍。有界KV-cache机制控制显存不随时间递增;尽管训练数据仅覆盖8秒时序片段,仍能完成分钟级连续rollout,车道、建筑与光照效果维持稳定。

四、它是怎么做出来的?
底座是“逐帧接龙”:每步只生成一个时刻的多视角画面,写进KV-cache再推下一步;两路Plücker adapter分别编码鱼眼和针孔的射线几何,自车运动、他车与车道布局逐帧注入。
40步压成1步,靠四阶段“师徒传功”:因果化、一致性蒸馏、自回滚DMD、RigCritic。结果:画质保持老师的90%以上,生成器耗时从3647秒降到92秒。
记忆模块是零初始化插件:刚接上对基座几乎零影响,不接时整层跳过。训练数据用端到端模型在真实场景上生成替代轨迹并重建渲染,已攒近百万对。
推理栈则抠每一毫秒:19M参数TinyVAE、W8A8低比特矩阵乘、自研推理框架通过硬件感知优化,单次推理进一步加速1.6倍。两张GPU协同合作可达1.7x加速比,叠加1step时延优化,最终达到107.7x加速,保障实时推理。

五、写在最后
ZYT-World带来的不是一段路测场景,也不是一段视频,而是一个可以被驶入、被改写、且认得路的平行世界。
当一个世界模型真正复刻了物理逻辑,模型在平行世界里习得的知识和分寸感,就能在现实中生效。不只是对一种车,而是对所有遵循同一套物理逻辑的移动载具。
ZYT-World不是宣称仿真已经替代路测,而是给出一条路径:把“最贵”、也“最危险”的那一课,先在平行世界里上完。
当经历不再受制于现实的偶然,“智能一切移动”才真正有了可被规模复制的前提。
多目全知,逐帧实时,万物可控,生成想象,记忆认路。






