DiffListener:基于离散扩散模型的听者生成
机器学习
2025-02-12 v1 计算与语言
图形学
摘要
听者头部生成 (LHG) 任务旨在根据说话者的多模态线索生成自然的非语言听者反应。虽然先前工作要么依赖有限的模态(如音频和面部信息),要么采用自回归方法,后者存在累积预测误差的局限性。为此,我们提出 DiffListener,一种基于离散扩散的方法,用于非自回归听者头部生成。我们的模型以说话者的面部信息、音频和文本为输入,同时纳入面部差分信息以表示表达和动作的时间动态。通过对面部动态的显式建模,DiffListener 能够以非自回归方式生成连贯的反应序列。通过全面实验,DiffListener 在定量和定性评估中均显示出最先进的性能。用户研究表明,DiffListener 生成的自然、情境感知的听者反应与说话者同步良好。代码和演示视频可在 https://siyeoljung.github.io/DiffListener 获取。
引用
@article{arxiv.2502.06822,
title = {DiffListener: Discrete Diffusion Model for Listener Generation},
author = {Siyeol Jung and Taehwan Kim},
journal= {arXiv preprint arXiv:2502.06822},
year = {2025}
}
备注
Accepted at ICASSP 2025