基于文本的迭代式说话头编辑:利用神经重定向
计算机视觉与模式识别
2020-11-24 v1 图形学
多媒体
摘要
我们提出了一种基于文本的说话头视频编辑工具,支持迭代式编辑工作流。在每次迭代中,用户可以编辑语音的措辞,必要时进一步细化嘴部动作以减少伪影,并通过插入嘴部手势(例如微笑)或改变整体表演风格(例如富有活力、喃喃低语)来操控表演的非语言方面。我们的工具仅需目标演员 2-3 分钟视频,并在每次迭代中约 40 秒合成视频,使用户能够在迭代时快速探索诸多编辑可能。我们的方法基于两个关键思路。(1)我们开发了快速音素搜索算法,可迅速识别源素材视频中最匹配所需编辑的音素级子序列,从而实现快速迭代循环。(2)我们利用源演员的大量视频库,并开发了一种新的自监督神经重定向技术,用于将源演员的嘴部动作迁移到目标演员。这使我们能够处理相对简短的目标演员视频,令我们的方法适用于许多真实世界的编辑场景。最后,我们的细化与表演控制赋予用户进一步微调合成结果的能力。
引用
@article{arxiv.2011.10688,
title = {Iterative Text-based Editing of Talking-heads Using Neural Retargeting},
author = {Xinwei Yao and Ohad Fried and Kayvon Fatahalian and Maneesh Agrawala},
journal= {arXiv preprint arXiv:2011.10688},
year = {2020}
}
备注
Project Website is https://davidyao.me/projects/text2vid