SalsaAgent:用于交互式舞蹈生成的多模态具身语言模型
计算机视觉与模式识别
2026-05-29 v1
摘要
人类机器人之间的相互作用涉及双向且非语言的反应、协调与同步。为了实现社交意识型机器人和交互式虚拟代理,我们提出SalsaAgent,这是一个能够针对人类领舞者以及背景音乐,生成具有表现力的全身萨尔萨舞动作的语言模型。我们将交互建模为非语言运动令牌传递,扩展大型语言模型(LLM)的词汇表,以处理离散运动令牌、成对关系令牌和音频。我们的贡献包括全身运动关系的新令牌、用于令牌对齐的自动派生骨架动态文本描述的LLM微调,以及基于令牌到扩散的两阶段管线。主观评估和客观评估均表明我们方法在运动质量、音乐和伙伴协调以及持续的两人空间行为方面的效果显著优于基线方法。
引用
@article{arxiv.2605.29219,
title = {SalsaAgent: A multimodal embodied language model for interactive dance generation},
author = {Payam Jome Yazdian and Zoe Stanley and Angelica Lim},
journal= {arXiv preprint arXiv:2605.29219},
year = {2026}
}