NatSGLD:面向自然人机交互的语音、手势、逻辑与演示数据集
机器人学
2025-02-25 v1 人工智能
摘要
近期多模态人机交互(HRI)数据集的进步强调语音和手势的集成,使机器人能够吸收显性知识和隐性理解。然而,现有数据集主要聚焦于对象指向和推送等基础任务,限制了其在复杂领域的适用性。它们优先考虑更简单的人类命令数据,但对训练机器人正确解释任务并作出恰当响应的能力关注不足。为此,我们present了NatSGLD数据集,该数据集采用魔术师拟人(Wizard of Oz, WoZ)方法收集,participant与他们认为是自主的机器人互动。NatSGLD记录了人类的多模态命令(语音和手势),每个命令都配有一个演示轨迹和一个线性时序逻辑(LTL)公式,提供对命令任务的ground-truth解释。该数据集为HRI与机器学习交叉领域的研究提供了基础资源。通过提供多模态输入和详细注释,NatSGLD使其研究得以探索包括多模态指令跟随、计划识别和人类可指导的演示强化学习等领域。我们在MIT许可下发布数据集和代码,网址为https://www.snehesh.com/natsgld/,以支持未来的HRI研究。
引用
@article{arxiv.2502.16718,
title = {NatSGLD: A Dataset with Speech, Gesture, Logic, and Demonstration for Robot Learning in Natural Human-Robot Interaction},
author = {Snehesh Shrestha and Yantian Zha and Saketh Banagiri and Ge Gao and Yiannis Aloimonos and Cornelia Fermüller},
journal= {arXiv preprint arXiv:2502.16718},
year = {2025}
}
备注
arXiv admin note: substantial text overlap with arXiv:2403.02274