NORA-1.5:基于世界模型和动作-based偏好奖励训练的视觉-语言-动作模型
机器人学
2025-11-19 v1 人工智能
摘要
视觉-语言-动作( VLA)模型最近在各种具身任务上显示出前景希望,但在可靠性和泛化能力方面仍有不足,尤其是在不同机体或真实环境中部署时。本文介绍NORA-1.5,一种基于预训练NORA主干网络,通过添加基于flow-matching的动作专家构建的VLA模型。这种架构增强本身即带来显著的性能提升,使NORA-1.5在模拟和真实环境基准测试中超越NORA和多种最先进VLA模型。为了进一步提高鲁棒性和任务成功率,我们开发了一套用于后训练VLA策略的奖励模型。我们的奖励组合了(i)一种动作条件世界模型(WM),用于评估生成的动作是否导向期望目标,以及(ii)一种与真实值偏差的启发式方法,用于区分良好动作和差动作。使用这些奖励信号,我们构建了偏好数据集,并通过直接偏好优化( DPO)将NORA-1.5适配目标机体。广泛的评估显示,奖励驱动的后训练在模拟和真实机器人设置中均能显著提升性能,表明通过简单而有效的奖励模型可实现显著的VLA模型可靠性提升。我们的发现表明,NORA-1.5和奖励导向的后训练是通向更可靠的具身智能体并适用于真实世界部署的可行路径。
关键词
引用
@article{arxiv.2511.14659,
title = {NORA-1.5: A Vision-Language-Action Model Trained using World Model- and Action-based Preference Rewards},
author = {Chia-Yu Hung and Navonil Majumder and Haoyuan Deng and Liu Renhang and Yankang Ang and Amir Zadeh and Chuan Li and Dorien Herremans and Ziwei Wang and Soujanya Poria},
journal= {arXiv preprint arXiv:2511.14659},
year = {2025}
}
备注
https://declare-lab.github.io/nora-1.5