中文

基于正则化驱动器与增强渲染器的感知对话头部生成

计算机视觉与模式识别 2022-08-03 v2

摘要

本文报道了我们在ACM Multimedia ViCo 2022对话头部生成挑战赛中的解决方案,该挑战赛旨在基于音频和参考图像生成生动的面对面对话视频。我们的方案侧重于使用正则化训练一个泛化的音频到头部驱动器,并组装一个高视觉质量的渲染器。我们细致调整音频到行为模型,并利用前景-背景融合模块对生成视频进行后处理。我们在官方排行榜的倾听头部生成赛道获得第一,在说话头部生成赛道获得第二。我们的代码可在 https://github.com/megvii-research/MM2022-ViCoPerceptualHeadGeneration 获取。

关键词

引用

@article{arxiv.2206.12837,
  title  = {Perceptual Conversational Head Generation with Regularized Driver and Enhanced Renderer},
  author = {Ailin Huang and Zhewei Huang and Shuchang Zhou},
  journal= {arXiv preprint arXiv:2206.12837},
  year   = {2022}
}

备注

Ailin and Zhewei contributed equally to this work. ACM MM22 workshop paper