Boximator:为视频合成生成丰富且可控的运动
计算机视觉与模式识别
2024-02-05 v1 人工智能
摘要
生成丰富且可控的运动是视频合成中的一个关键挑战。我们提出了 Boximator,一种用于细粒度运动控制的新方法。Boximator 引入了两种约束类型:硬框和软框。用户使用硬框在条件帧中选择对象,然后使用任一类型的框来粗略或严格地定义该对象在未来帧中的位置、形状或运动路径。Boximator 作为现有视频扩散模型的插件运行。其训练过程通过冻结原始权重并仅训练控制模块来保留基础模型的知识。为了解决训练难题,我们引入了一种新颖的自跟踪技术,极大地简化了框-对象相关性的学习。实验表明,Boximator 在两个基础模型上均取得了最先进的视频质量 (FVD) 分数,并在加入框约束后进一步提升。其稳健的运动可控性通过边界框对齐指标的显著提高得到验证。人类评估也表明,用户更偏好 Boximator 的生成结果而非基础模型。
引用
@article{arxiv.2402.01566,
title = {Boximator: Generating Rich and Controllable Motions for Video Synthesis},
author = {Jiawei Wang and Yuchen Zhang and Jiaxin Zou and Yan Zeng and Guoqiang Wei and Liping Yuan and Hang Li},
journal= {arXiv preprint arXiv:2402.01566},
year = {2024}
}
备注
16 pages, 9 figures