CosAvatar:基于文本提示的一致且可驱动的人像视频微调
计算机视觉与模式识别
2023-12-01 v1
摘要
近年来,文本引导的数字人像编辑吸引了越来越多的关注。然而,现有方法仍难以在时间、表情和视角上保持一致性,或需要特定的数据前提条件。为解决这些具有挑战性的问题,我们提出了 CosAvatar,一个高质量且用户友好的肖像微调框架。仅以单目视频和文本指令作为输入,我们即可生成兼具时间一致性与三维一致性的可驱动人像。与直接在二维域中编辑的方法不同,我们采用基于动态 NeRF 的三维人像表示来建模头部与躯干。我们在编辑视频帧数据集与更新底层三维人像之间交替进行,直至编辑后的帧达到三维一致性。此外,我们整合了语义人像先验以增强编辑结果,从而允许在指定语义区域进行精确修改。大量结果表明,我们提出的方法不仅能基于文本指令准确编辑人像风格或局部属性,还支持由源视频驱动富有表现力的动画。
引用
@article{arxiv.2311.18288,
title = {CosAvatar: Consistent and Animatable Portrait Video Tuning with Text Prompt},
author = {Haiyao Xiao and Chenglai Zhong and Xuan Gao and Yudong Guo and Juyong Zhang},
journal= {arXiv preprint arXiv:2311.18288},
year = {2023}
}
备注
Project page: https://ustc3dv.github.io/CosAvatar/