J-ORA:面向日语机器人感知的对象识别、参考与动作预测框架与数据集
机器人学
2025-10-28 v1 人工智能
计算机视觉与模式识别
摘要
我们介绍 J-ORA,一个新的多模态数据集,用于弥合机器人感知中的差距,通过提供日语人机对话场景中对象的详细属性注释。J-ORA 旨在通过综合的属性模板(例如类别、颜色、形状、大小、材料和空间关系)支持三个关键感知任务:对象识别、参考解析和下一动作预测。使用专有和开源视觉语言模型(VLMs)进行大规模评估显示,纳入详细对象属性后,多模态感知性能显著优于不使用对象属性的情况。尽管存在改进,但我们发现专有 VLMs 与开源 VLMs 之间仍存在差距。此外,我们的分析表明,不同 VLMs 在理解对象功能和上下文关系方面的能力存在差异。这些发现凸显了在动态环境中发展机器人感知能力所需的丰富、具有上下文感知性的属性注释的重要性。项目页面请访问 https://jatuhurrra.github.io/J-ORA/。
引用
@article{arxiv.2510.21761,
title = {J-ORA: A Framework and Multimodal Dataset for Japanese Object Identification, Reference, Action Prediction in Robot Perception},
author = {Jesse Atuhurra and Hidetaka Kamigaito and Taro Watanabe and Koichiro Yoshino},
journal= {arXiv preprint arXiv:2510.21761},
year = {2025}
}
备注
Accepted to IROS2025