FlexAM:用于灵活外观-运动分解的通用视频生成控制框架
计算机视觉与模式识别
2026-02-16 v1 图形学
摘要
视频生成中的有效且可泛化控制仍是一个重要挑战。虽然许多方法依赖模糊或任务特定的信号,但我们认为将"外观"与"运动"彻底分离提供了更稳健且可扩展的路径。我们提出了 FlexAM,一个基于新颖 3D 控制信号的统一框架。该信号将视频动力学表示为点云,引入了三个关键改进:多频率位置编码以区分细粒度运动、深度感知位置编码以及灵活的控制信号用于平衡精度与生成质量。这种表示方法使 FlexAM 能够有效分离外观与运动,从而支持包括 I2V/V2V 编辑、摄像机控制和空间对象编辑在内的广泛任务。大量实验表明,FlexAM 在所有评估任务中均实现了卓越的性能。
引用
@article{arxiv.2602.13185,
title = {FlexAM: Flexible Appearance-Motion Decomposition for Versatile Video Generation Control},
author = {Mingzhi Sheng and Zekai Gu and Peng Li and Cheng Lin and Hao-Xiang Guo and Ying-Cong Chen and Yuan Liu},
journal= {arXiv preprint arXiv:2602.13185},
year = {2026}
}
备注
Codes: https://github.com/IGL-HKUST/FlexAM