MoFu:面向多主体视频生成的尺度感知调制与傅里叶融合
计算机视觉与模式识别
2025-12-30 v1
摘要
多主体视频生成旨在从文本提示和多个参考图像合成视频,确保每个主体保留自然的尺度和视觉保真度。然而,现有方法面临两个挑战:尺度不一致,即主体大小变化导致生成结果不自然;以及排列敏感性,即参考输入的顺序导致主体变形。本文提出了 MoFu 框架,以解决上述两个问题。针对尺度不一致,我们引入尺度感知调制(SMO),这是一种由大语言模型驱动的模块,从提示中提取隐式尺度线索,并对特征进行调制,以确保主体尺寸一致。为解决排列敏感性,我们提出了一种简单而有效的傅里叶融合策略,通过快速傅里叶变换处理参考特征的频率信息,以生成统一的表示。此外,我们设计了尺度-排列稳定性损失,以联合鼓励尺度一致和排列不变的生成。为进一步评估这些挑战,我们建立了一个包含受控主体尺度变化和参考排列变换的专门基准。广泛的实验表明,MoFu 在保持自然尺度、主体保真度以及整体视觉质量方面显著优于现有方法。
引用
@article{arxiv.2512.22310,
title = {MoFu: Scale-Aware Modulation and Fourier Fusion for Multi-Subject Video Generation},
author = {Run Ling and Ke Cao and Jian Lu and Ao Ma and Haowei Liu and Runze He and Changwei Wang and Rongtao Xu and Yihua Shao and Zhanjie Zhang and Peng Wu and Guibing Guo and Wei Feng and Zheng Zhang and Jingjing Lv and Junjie Shen and Ching Law and Xingwei Wang},
journal= {arXiv preprint arXiv:2512.22310},
year = {2025}
}
备注
AAAI 2026