中文

SMRABooth:面向定制视频生成的主体与运动表示对齐

计算机视觉与模式识别 2025-12-16 v1

摘要

定制视频生成旨在生成忠实保留参考图像中主体外观的视频,同时保持参考视频中持续一致的运动。现有方法难以同时确保主体外观相似性和运动模式一致性,因缺乏针对主体与运动的对象级指导。为此,我们提出 SMRABooth,利用自监督编码器和光流编码器提供对象级的主体与运动表示,并在 LoRA 微调过程中将这些表示与模型对齐。我们的方法包含三个核心阶段:(1) 我们利用主体表示通过自监督编码器指导主体对齐,使模型能够捕捉主体的整体结构并增强高层语义一致性;(2) 我们利用来自光流编码器的运动表示,以独立于外观的结构方式捕获一致且对象级的运动轨迹;(3) 我们提出一种主体-运动关联解耦策略,通过稀疏 LoRA 在位置和时机上的注入,有效减少主体 LoRA 与运动 LoRA 之间的干扰。大量实验表明,SMRABooth 在主体和运动定制方面表现优异,保持一致的主体外观和运动模式,证明其在可控文本到视频生成中的有效性。

关键词

引用

@article{arxiv.2512.12193,
  title  = {SMRABooth: Subject and Motion Representation Alignment for Customized Video Generation},
  author = {Xuancheng Xu and Yaning Li and Sisi You and Bing-Kun Bao},
  journal= {arXiv preprint arXiv:2512.12193},
  year   = {2025}
}