中文

SimCoachCorpus:用于具身教学的自然化语言与轨迹数据集

机器人学 2025-09-19 v1 人机交互

摘要

精选数据集对训练和评估AI方法至关重要,但在语言与物理动作深度交织的领域数据集常常缺乏。特别是,很少有数据集捕捉人们通过语言指令获取具身技能的过程。为填补这一空白,我们介绍SimCoachCorpus:一个包含赛车模拟驾驶语言与轨迹的独特数据集,允许研究者在引导式与非引导式运动技能获取期间,调查丰富的交互现象。在该数据集中,29名参与者被要求在模拟器中驾驶赛车约九十分钟。其中15名参与者来一位专业性能驾驶教练提供个性化一对一指导,另14名参与者则在无教练指导下驾驶。数据集包含车辆状态与输入、地图(赛道边界与最佳行驶线)、锥桩标志等具身特征,这些特征与专业教练的实时语言指导以及每圈结束后的额外反馈同步。我们进一步提供了教练类别注释、学生遵循指导建议的合规性评分,以及参与者自报的认知负荷和情绪状态(通过实验中的调查获取)。数据集包含超过20,000条同步反馈言语、超过400条终端反馈言语,以及超过40小时的车辆驾驶数据。该自然化数据集可用于探索运动学习动力学、研究语言现象,并训练教学计算模型。我们展示了该数据集用于情境学习、模仿学习和主题建模的应用。本文引入的数据集将在经过同行评审的论文版本发布后公开。希望提前获取数据集的研究者可注册 https://tinyurl.com/SimCoachCorpusForm。

关键词

引用

@article{arxiv.2509.14548,
  title  = {SimCoachCorpus: A naturalistic dataset with language and trajectories for embodied teaching},
  author = {Emily Sumner and Deepak E. Gopinath and Laporsha Dees and Patricio Reyes Gomez and Xiongyi Cui and Andrew Silva and Jean Costa and Allison Morgan and Mariah Schrum and Tiffany L. Chen and Avinash Balachandran and Guy Rosman},
  journal= {arXiv preprint arXiv:2509.14548},
  year   = {2025}
}