中文

VividListener:面向多模态自适应交互的可表达且可控听者动态建模

计算机视觉与模式识别 2025-05-08 v2

摘要

生成带有细腻情感和富有表现力的听者头部动态,对虚拟头像动画中的对话建模至关重要。以往研究主要关注听者行为的直接短期生成,忽略了对动作变化和情感强度的细粒度控制,尤其在长序列建模方面。此外,缺乏包含头部动态和细粒度多模态注释(如基于文本的情感描述、情感强度)的长期大规模配对说话人-听者语料库也限制了对话建模的应用。因此,我们首次收集了包含超过140万有效帧的大规模多轮3D二人对话数据集,称为ListenerX。此外,我们提出VividListener,一个实现细粒度、可表达且可控听者动态建模的新框架。该框架将多模态条件作为引导原则,以促进说话人和听者之间协调的交互。具体而言,我们设计了响应交互模块 (RIM),以适应方式表示多模态交互嵌入。RIM确保听者动态在文本描述和情感强度调整方面实现细粒度语义协调,同时保持与说话人行为的富有表现力的反应。我们还设计了情感强度标签 (EIT),用于整合多模态信息进行情感强度编辑,同时可用于文本描述和听者动作幅度。针对我们新收集的ListenerX数据集进行的大量实验表明,VividListener实现了最先进的性能,实现了可表达且可控的听者动态。

关键词

引用

@article{arxiv.2504.21718,
  title  = {VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction},
  author = {Shiying Li and Xingqun Qi and Bingkun Yang and Chen Weile and Zezhao Tian and Muyi Sun and Qifeng Liu and Man Zhang and Zhenan Sun},
  journal= {arXiv preprint arXiv:2504.21718},
  year   = {2025}
}