中文

基于自回归离散化预训练的统一具身VLM推理与机器人动作

机器人学 2026-01-05 v2 人工智能

摘要

在开放世界环境中运行的通用机器人系统必须同时实现广泛的泛化能力和高精度的动作执行,这一组合对现有的视觉-语言-动作(VLA)模型而言仍具挑战性。虽然大型视觉-语言模型(VLM)改善了语义泛化,但具身推理不足会导致行为脆弱;反之,仅有强大的推理能力而缺乏精确控制也是不够的。为了对这一瓶颈进行解耦和定量评估,我们引入了具身推理智商(ERIQ),这是一个面向机器人操作的大规模具身推理基准,包含跨越四个推理维度的6000多个问答对。通过将推理与执行解耦,ERIQ能够进行系统性评估,并揭示了具身推理能力与端到端VLA泛化之间存在强正相关。为了弥合从推理到精确执行的差距,我们提出了FACT,一种基于流匹配的动作分词器,它将连续控制转换为离散序列,同时保持高保真度的轨迹重建。由此产生的GenieReasoner在统一空间中联合优化推理与动作,在现实世界任务中优于连续动作和先前的离散动作基线。ERIQ和FACT共同提供了一个原则性框架,用于诊断和克服推理与精度之间的权衡,从而推动鲁棒、通用的机器人操作。项目页面:https://geniereasoner.github.io/GenieReasoner/

关键词

引用

@article{arxiv.2512.24125,
  title  = {Unified Embodied VLM Reasoning with Robotic Action via Autoregressive Discretized Pre-training},
  author = {Yi Liu and Sukai Wang and Dafeng Wei and Xiaowei Cai and Linqing Zhong and Jiange Yang and Guanghui Ren and Jinyu Zhang and Maoqing Yao and Chuankang Li and Xindong He and Liliang Chen and Jianlan Luo},
  journal= {arXiv preprint arXiv:2512.24125},
  year   = {2026}
}