DreamRelation:面向关系导向的视频定制化
计算机视觉与模式识别
2025-03-11 v1
摘要
关系视频定制指的是创建呈现用户指定主体之间关系的个性化视频,这是理解真实世界视觉内容的关键任务。虽然现有方法可以个性化主体的外观和动作,但仍难以处理复杂的关系视频定制,其中精确的关系建模和跨类别的高泛化能力至关重要。主要挑战源于关系所固有的复杂空间布局、布局变化以及细微的时序动态;因此,当前模型倾向于过度强调无关视觉细节,而非捕捉有意义的互动。为解决这些挑战,我们提出DreamRelation,一种通过小套示例视频来实现关系个性化的新方法,基于两个关键组件:关系解耦学习(Relational Decoupling Learning)和关系动态增强(Relational Dynamics Enhancement)。首先,在关系解耦学习中,我们通过关系LoRA三元组和混合掩码训练策略将关系从主体外观中解耦,确保其在多样化关系上具备更好的泛化能力。此外,我们通过分析查询、键和值特征在MM-DiT注意力机制中的不同角色,确定关系LoRA三元组的最佳设计,使DreamRelation成为首个具有可解释组件的关系视频生成框架。其次,在关系动态增强中,我们引入空间时间关系对比损失(space-time relational contrastive loss),以优先考虑关系动态,最小化对详细主体外观的依赖。大量实验表明,DreamRelation在关系视频定制方面优于当前最先进的方法。代码和模型将公开提供。
引用
@article{arxiv.2503.07602,
title = {DreamRelation: Relation-Centric Video Customization},
author = {Yujie Wei and Shiwei Zhang and Hangjie Yuan and Biao Gong and Longxiang Tang and Xiang Wang and Haonan Qiu and Hengjia Li and Shuai Tan and Yingya Zhang and Hongming Shan},
journal= {arXiv preprint arXiv:2503.07602},
year = {2025}
}
备注
Project Page: https://dreamrelation.github.io