Salsa 作为非语言具身语言 —— CoMPAS3D 数据集与基准测试
机器学习
2025-07-29 v1 人工智能
计算与语言
计算机视觉与模式识别
摘要
想象一个能够安全且富有创造性地与人类跳舞的人形机器人,能够适应其伙伴的水平,通过触觉信号作为主要交流方式。虽然今天的人工智能系统在文本或语音交互方面与大型语言模型一流,然而人类交流远不止于文本——它包括具身运动、节奏和身体协调。建模两个代理之间的相互作用具有巨大挑战:这种交互是连续的、双向反应性的,并且受个体差异的影响。我们提出了 CoMPAS3D,这是目前规模最大、样本性最丰富的即兴 salsa 舞蹈动作捕捉数据集,旨在作为交互式、具象化人形 AI 的具有挑战性的测试基准。该数据集包含 3 小时由 18 位舞者(覆盖初学者、中级和专业水平)进行的领袖-跟随 salsa 舞蹈。首次提供细粒度的 salsa 专家标注,覆盖超过 2800 段动作,包括动作类型、组合、执行错误和风格元素。我们将伴侣舞蹈交流类比于自然语言,在两个基准任务上评估 CoMPAS3D,这两个任务为合成人类类比关键问题:领袖或跟随生成(说话者或听者合成),以及二人合唱(对话)生成。为实现与人类伴侣舞蹈的长期目标,我们发布数据集、标注和代码,并提供一个能够完成所有基准任务的多任务 SalsaAgent 模型,同时提供额外的基线模型,以鼓励社交交互式具身 AI 和创造性、具象化的人形运动生成研究。
引用
@article{arxiv.2507.19684,
title = {Salsa as a Nonverbal Embodied Language -- The CoMPAS3D Dataset and Benchmarks},
author = {Bermet Burkanova and Payam Jome Yazdian and Chuxuan Zhang and Trinity Evans and Paige Tuttösí and Angelica Lim},
journal= {arXiv preprint arXiv:2507.19684},
year = {2025}
}
备注
https://rosielab.github.io/compas3d