何为优良的说话头视频生成?:一项综述与基准
计算机视觉与模式识别
2020-05-08 v1 图像与视频处理
摘要
多年来,性能评估在计算机视觉中已不可或缺,使许多子领域取得切实进展。尽管说话头视频生成已成为新兴研究课题,现有针对该主题的评估存在诸多局限。例如,多数方法直接使用人类受试者(如通过 Amazon MTurk)来评估其研究主张。这种主观评估繁琐、不可复现,且可能阻碍新研究的演进。本工作中,我们提出一个精心设计的基准,以标准化数据集预处理策略评估说话头视频生成。在评估方面,我们或提出新指标,或选取最恰当的指标,从我们认为优良说话头视频应具备的属性——即身份保持、唇形同步、高视频质量与自然自发运动——来评估结果。通过对若干最先进说话头生成方法的审慎分析,我们旨在揭示当前方法的优劣并指出未来工作的有前景方向。所有评估代码见:https://github.com/lelechen63/talking-head-generation-survey。
引用
@article{arxiv.2005.03201,
title = {What comprises a good talking-head video generation?: A Survey and Benchmark},
author = {Lele Chen and Guofeng Cui and Ziyi Kou and Haitian Zheng and Chenliang Xu},
journal= {arXiv preprint arXiv:2005.03201},
year = {2020}
}