MFR-Net:基于去噪扩散模型的多维度响应式倾听头部生成
计算机视觉与模式识别
2023-09-01 v1
摘要
面对面交流是一种包含说话者与倾听者角色的常见场景。现有大多数研究方法集中于生成说话者视频,而倾听者头部的生成在很大程度上被忽视。响应式倾听头部生成是一项重要任务,旨在给定说话者视频和倾听者头部图像的条件下,通过生成倾听者头部视频来建模面对面交流场景。理想的生成响应式倾听视频应针对说话者作出带有态度或观点表达的反应,同时保持交互模式的多样性以及倾听者身份信息的准确性。为实现这一目标,我们提出了多维度响应式倾听头部生成网络(MFR-Net)。具体而言,MFR-Net采用概率去噪扩散模型来预测多样的头部姿态与表情特征。为对说话者视频作出多维度响应,同时保持准确的倾听者身份保留,我们设计了特征聚合模块以增强倾听者身份特征并将其与其他说话者相关特征融合。最后,使用身份一致性损失微调的渲染器生成最终的倾听头部视频。我们的大量实验表明,MFR-Net不仅在多样性与说话者身份信息方面,也在态度与观点表达方面实现了多维度响应。
引用
@article{arxiv.2308.16635,
title = {MFR-Net: Multi-faceted Responsive Listening Head Generation via Denoising Diffusion Model},
author = {Jin Liu and Xi Wang and Xiaomeng Fu and Yesheng Chai and Cai Yu and Jiao Dai and Jizhong Han},
journal= {arXiv preprint arXiv:2308.16635},
year = {2023}
}
备注
Accepted by ACM MM 2023