Xiaomi OneVL:一种带有视觉语言解释的一步式隐式推理与规划
组合数学
2026-04-21 v1
摘要
链式思维 (CoT) 推理已成为基于视觉-语言-动作 (VLA) 的自动驾驶轨迹预测的强大驱动力,但其自回归本质导致实际部署受限于延迟。隐式 CoT 方法试图通过压缩推理到连续隐藏状态来弥补这一差距,但始终不足以媲美其显式对应物。我们认为这源于纯语言隐式表示压缩的是世界的符号抽象,而非实际支配驾驶的因果动力学。因此,我们提出了 OneVL (一种视觉语言解释的一步式隐式推理与规划),一个统一的 VLA 和 World Model 框架,其推理通过由双辅助解码器监督的紧凑隐式 token 完成。在语言解码器重建文本 CoT 之外,我们引入了视觉世界模型解码器,用于预测未来帧 token,迫使隐式空间内化道路几何、代理运动和环境变化的因果动力学。我们设计了一个三阶段训练管道,逐步将这些隐式与轨迹、语言和视觉目标对齐,确保稳定的联合优化。在推理期间,丢弃辅助解码器,所有隐式 token 同时预填充单一并行传递,匹配仅答案预测的速度。在四个基准测试中,OneVL 成为首个超越显式 CoT 的隐式 CoT 方法,在答案-only 延迟下实现了卓越的准确率。这些结果表明,随着世界模型监督,隐式 CoT 能产生比冗长的逐 token 推理更具可迁移性的表示。代码已开源至社区。项目页面: https://xiaomi-embodied-intelligence.github.io/OneVL
引用
@article{arxiv.2604.18485,
title = {An elementary proof of Sierksma's conjecture for seven points in the plane},
author = {Pablo Soberón},
journal= {arXiv preprint arXiv:2604.18485},
year = {2026}
}
备注
5 pages, 2 figures