MAGREF:基于主体解耦的任意参考视频生成掩码引导
计算机视觉与模式识别
2025-10-10 v2 人工智能
摘要
我们处理任意参考视频生成任务,旨在根据任意类型的参考主体及其组合与文本提示进行视频合成。该任务面临持续的挑战,包括身份不一致、多个参考主体之间的纠缠以及复制粘贴伪影。为了解决这些问题,我们引入了 MAGREF,一个用于任意参考视频生成的统一且有效的框架。我们的方法结合了掩码引导和主体解耦机制,实现了以多样化参考图像和文本提示为条件的灵活合成。具体而言,掩码引导采用区域感知掩码机制结合逐像素通道拼接,以沿通道维度保留多个主体的外观特征。这种设计保留了身份一致性并维持了预训练骨干网络的能力,而无需任何架构更改。为了减轻主体混淆,我们引入了一种主体解耦机制,将源自文本条件的每个主体的语义值注入其对应的视觉区域。此外,我们建立了一个四阶段数据管道来构建多样化的训练对,有效缓解了复制粘贴伪影。在综合基准上的大量实验表明,MAGREF 始终优于现有的 SOTA 方法,为可扩展、可控和高保真的任意参考视频合成铺平了道路。代码和模型可在以下网址找到:https://github.com/MAGREF-Video/MAGREF
引用
@article{arxiv.2505.23742,
title = {MAGREF: Masked Guidance for Any-Reference Video Generation with Subject Disentanglement},
author = {Yufan Deng and Yuanyang Yin and Xun Guo and Yizhi Wang and Jacob Zhiyuan Fang and Shenghai Yuan and Yiding Yang and Angtian Wang and Bo Liu and Haibin Huang and Chongyang Ma},
journal= {arXiv preprint arXiv:2505.23742},
year = {2025}
}
备注
Code: https://github.com/MAGREF-Video/MAGREF/; Project website: https://magref-video.github.io/