情感听众肖像:带情感神经听众头部生成
图形学
2023-10-10 v2 人工智能
多媒体
摘要
听众头部生成侧重于参照说话者所传递的信息来生成听众的非言语行为(如微笑)。生成此类响应的一个重大挑战是会话中细粒度面部表情的非确定性本质,其随说话者与听众双方的情绪和态度而变化。为应对该问题,我们提出情感听众肖像(ELP),将每个细粒度面部运动视为若干离散运动码词的组合,并显式建模对话中不同情感下运动的概率分布。得益于“显式”与“离散”的设计,我们的 ELP 模型不仅可通过从所学分布中采样自动生成面向给定说话者的自然且多样的响应,还能以预定态度生成可控响应。在多项量化指标下,我们的 ELP 相较先前方法表现出显著提升。
引用
@article{arxiv.2310.00068,
title = {Emotional Listener Portrait: Neural Listener Head Generation with Emotion},
author = {Luchuan Song and Guojun Yin and Zhenchao Jin and Xiaoyi Dong and Chenliang Xu},
journal= {arXiv preprint arXiv:2310.00068},
year = {2023}
}
备注
Accepted by ICCV2023