NewMove:利用新颖动作定制文本到视频模型
计算机视觉与模式识别
2024-12-11 v2
摘要
我们引入了一种用定制动作增强文本到视频生成模型的方法,将其能力扩展到原始训练数据中描绘的动作之外。通过利用少量展示特定运动的视频样本作为输入,我们的方法学习并泛化输入的运动模式,以适用于多样的、由文本指定的场景。我们的贡献有三方面。首先,为了实现我们的结果,我们对现有的文本到视频模型进行微调,以学习输入示例中描绘的运动与一个新的唯一标记之间的映射。为了避免对新定制动作的过拟合,我们引入了一种对视频进行正则化的方法。其次,通过利用预训练模型中的动作先验,我们的方法能够生成以多个人物执行定制动作为特色的新颖视频,并且能够将该动作与其他动作结合调用。此外,我们的方法扩展到个性化主体的动作与外观的多模态定制,从而能够生成具有独特角色和不同动作的视频。第三,为了验证我们的方法,我们引入了一种定量评估所学定制动作的方法,并进行了系统的消融研究。我们表明,当扩展到动作定制任务时,我们的方法显著优于先前基于外观的定制方法。
引用
@article{arxiv.2312.04966,
title = {NewMove: Customizing text-to-video models with novel motions},
author = {Joanna Materzynska and Josef Sivic and Eli Shechtman and Antonio Torralba and Richard Zhang and Bryan Russell},
journal= {arXiv preprint arXiv:2312.04966},
year = {2024}
}
备注
Project page: this website https://joaanna.github.io/customizing_motion/