从像素到肖像:说话人头生成技术及应用综述
计算机视觉与模式识别
2023-08-31 v1
摘要
深度学习和计算机视觉的最新进展引发了人们对生成逼真说话人头的浓厚兴趣。本文对说话人头生成的最先进方法进行了全面综述。我们将其系统地归类为四种主要方法:图像驱动、音频驱动、视频驱动以及其他(包括神经辐射场(NeRF)和基于3D的方法)。我们对每种方法进行了深入分析,突出其独特贡献、优势与局限。此外,我们详尽比较了公开可用的模型,在推理时间和生成输出的人工评分质量等关键方面对其评估。我们的目的是提供说话人头生成当前图景的清晰而简洁的概览,阐明不同方法之间的关系并指明有前景的未来研究方向。本综述将作为对这一快速发展领域感兴趣的研究人员和从业者的宝贵参考。
引用
@article{arxiv.2308.16041,
title = {From Pixels to Portraits: A Comprehensive Survey of Talking Head Generation Techniques and Applications},
author = {Shreyank N Gowda and Dheeraj Pandey and Shashank Narayana Gowda},
journal= {arXiv preprint arXiv:2308.16041},
year = {2023}
}