NORA:一个面向具身任务的小型开源通用视觉语言动作模型
机器人学
2025-04-29 v1 人工智能
计算机视觉与模式识别
摘要
现有的视觉-语言-动作模型在零样本场景中展示了有前景的性能,表现出令人印象深刻的任务执行和推理能力。然而,一个重大挑战来自视觉编码的限制,这可能导致在物体抓取等任务中失败。此外,这些模型通常由于规模较大(通常超过7B参数)而承受高计算开销。虽然这些模型在推理和任务规划方面表现出色,但它们产生的大量计算开销使其在实时机器人环境中不切实际,而速度和效率至关重要。为了解决现有VLA模型的局限性,我们提出了NORA,一个3B参数模型,旨在减少计算开销的同时保持强大的任务性能。NORA采用Qwen-2.5-VL-3B多模态模型作为其骨干,利用其优越的视觉语义理解来增强视觉推理和动作基础。此外,我们的模型在97万次真实世界机器人演示上进行了训练,并配备了FAST+分词器以实现高效的动作序列生成。实验结果表明,NORA优于现有的大规模VLA模型,在显著降低计算开销的同时实现了更好的任务性能,使其成为实时机器人自主性的更实用解决方案。
引用
@article{arxiv.2504.19854,
title = {NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks},
author = {Chia-Yu Hung and Qi Sun and Pengfei Hong and Amir Zadeh and Chuan Li and U-Xuan Tan and Navonil Majumder and Soujanya Poria},
journal= {arXiv preprint arXiv:2504.19854},
year = {2025}
}