MetaDance:基于时间感知元学习的少样本舞蹈视频重定向
计算机视觉与模式识别
2022-01-14 v1
摘要
舞蹈视频重定向旨在合成将源视频中舞蹈动作迁移至目标人物的视频。以往工作需收集目标人物数千帧、长达数分钟的视频来训练个性化模型,且训练后的模型只能生成同一人物的视频。为克服这些局限,近期工作处理了少样本舞蹈视频重定向,即利用目标人物的少量帧来学习合成未见人物的视频。实践中,给定人物的少量帧,这些工作简单将其视为无时间关联的一批独立图像,从而生成时间上不连贯、视觉质量低的舞蹈视频。本文中,我们将人物的少量帧建模为一系列舞蹈动作,每个动作包含连续两帧,以提取该人物的外观模式与时间动态。我们提出 MetaDance,利用时间感知元学习通过舞蹈动作的合成来优化模型初始化,使元训练后的模型能用少量帧高效调优,以提升未见人物的视觉质量并增强时间稳定性。大量评测显示了本方法的显著优越性。
引用
@article{arxiv.2201.04851,
title = {MetaDance: Few-shot Dancing Video Retargeting via Temporal-aware Meta-learning},
author = {Yuying Ge and Yibing Song and Ruimao Zhang and Ping Luo},
journal= {arXiv preprint arXiv:2201.04851},
year = {2022}
}