中文

从说话人语料生成反应式听者动作

计算机视觉与模式识别 2026-03-17 v1 人工智能 人机交互 多媒体 声音

摘要

本文提出了一种新任务——从说话人语料生成反应式听者动作,旨在生成能够恰当地响应说话人语料的自然听者身体动作。然而,建模此类非语言听者行为仍未得到充分探索且具有挑战性,因为人类反应本质上具有非确定性。为促进这一任务,我们提出了 ReactMotionNet,一个大型数据集,将说话人语料与多个带有不同恰当性程度的听者动作候选对象配对。这种数据集设计显式地捕获了听者行为的一种对多的特性,并提供了单一基准动作之外的监督。基于这种数据集设计,我们开发了针对评估反应恰当性的偏好导向评估方案,其中常规动作指标侧重于输入-动作对齐而忽略了其他因素。我们进一步提出了 ReactMotion,一个统一的生成框架,联合建模文本、音频、情感和动作,并使用偏好目标进行训练,以鼓励恰当且多样的听者响应。大量实验表明,ReactMotion 在检索基线和级联 LLM 管道方面显著优于,生成更自然、更多样且更恰当的听者动作。

关键词

引用

@article{arxiv.2603.15083,
  title  = {ReactMotion: Generating Reactive Listener Motions from Speaker Utterance},
  author = {Cheng Luo and Bizhu Wu and Bing Li and Jianfeng Ren and Ruibin Bai and Rong Qu and Linlin Shen and Bernard Ghanem},
  journal= {arXiv preprint arXiv:2603.15083},
  year   = {2026}
}

备注

42 pages, 11 tables, 8 figures