基于正则化驱动器与增强渲染器的感知对话头部生成
计算机视觉与模式识别
2022-08-03 v2
摘要
本文报道了我们在ACM Multimedia ViCo 2022对话头部生成挑战赛中的解决方案,该挑战赛旨在基于音频和参考图像生成生动的面对面对话视频。我们的方案侧重于使用正则化训练一个泛化的音频到头部驱动器,并组装一个高视觉质量的渲染器。我们细致调整音频到行为模型,并利用前景-背景融合模块对生成视频进行后处理。我们在官方排行榜的倾听头部生成赛道获得第一,在说话头部生成赛道获得第二。我们的代码可在 https://github.com/megvii-research/MM2022-ViCoPerceptualHeadGeneration 获取。
引用
@article{arxiv.2206.12837,
title = {Perceptual Conversational Head Generation with Regularized Driver and Enhanced Renderer},
author = {Ailin Huang and Zhewei Huang and Shuchang Zhou},
journal= {arXiv preprint arXiv:2206.12837},
year = {2022}
}
备注
Ailin and Zhewei contributed equally to this work. ACM MM22 workshop paper