中文

RoboAlign-R1:机器人视频世界模型的蒸馏式多模态奖励对齐

机器人学 2026-05-06 v1 人工智能

摘要

现有的机器人视频世界模型通常使用重建和感知相似性等低层目标进行训练,这些目标与机器人决策最相关的能力(包括指令遵循、操纵成功和物理可行性)对齐性较差。此外,这些模型也受长程自回归预测中的误差积累的影响。我们提出了 RoboAlign-R1,一种结合奖励对齐后训练与稳定长程推理的框架,用于机器人视频世界模型。我们构建了 RobotWorldBench,一个包含 10,000 个标注好的视频-指令对,来自四个机器人数据来源。我们训练一个多模态教师评判器 RoboAlign-Judge,提供对生成视频的细粒度六维评估。随后,我们将教师模型蒸馏为轻量级学生奖励模型,以实现高效的强化学习后训练。为减少长程 rollout 中的漂移,我们进一步引入了滑动窗口重编码(SWR),一种训练自由的推理策略,定期刷新生成上下文。在我们的领域内评估协议下,RoboAlign-R1 在最强基线之上提高了 10.1% 的综合六维得分,包括在操纵准确率和指令遵循方面的分别提升 7.5% 和 4.6%;这些排名改进进一步得到外部基于视觉语言模型的交叉检查和盲人人类研究的支持。与此同时,SWR仅增加约 1% 的延迟,即可提高长程预测质量,使 SSIM 提升 2.8%,LPIPS 降低 9.8%。综上,这些结果表明,奖励对齐后训练和稳定的长程解码可提高机器人视频世界模型的任务一致性、物理真实性和长程预测质量。

关键词

引用

@article{arxiv.2605.03821,
  title  = {RoboAlign-R1: Distilled Multimodal Reward Alignment for Robot Video World Models},
  author = {Hao Wu and Yuqi Li and Yuan Gao and Fan Xu and Fan Zhang and Kun Wang and Penghao Zhao and Qiufeng Wang and Yizhou Zhao and Weiyan Wang and Yingli Tian and Xian Wu and Xiaomeng Huang},
  journal= {arXiv preprint arXiv:2605.03821},
  year   = {2026}
}