LumosX:面向个性化视频生成的身份-属性关联框架
计算机视觉与模式识别
2026-03-23 v1 人工智能
摘要
近期扩散模型的进展显著提升了文本到视频生成能力,使个性化内容创建在对前景和背景元素实现细粒度控制方面取得了突破。然而,跨主体的精确面部属性对齐仍具有挑战性,因为现有方法缺乏确保类内一致性的显式机制。解决这一问题需要显式建模策略和面部属性感知的数据资源。因此,我们提出LumosX,同步推进数据和模型设计。在数据层面,定制化的收集管道协调来自独立视频的标题和视觉线索,同时利用多模态大语言模型(MLLMs)推断并分配主题特定的依赖关系。这些提取的关系先验引入更细粒度的结构,放大了个性化视频生成的表达控制能力,使能够构建一个全面的基准。在模型层面,关系自注意力(Relational Self-Attention)和关系交叉注意力(Relational Cross-Attention)将位置感知嵌入与精炼注意力动态相互交织,体现显式的主体-属性依赖关系,强制实现类内团结一致,并放大不同主体簇之间的分离。对我们基准上全面评估显示,LumosX在细粒度、身份一致和语义对齐的个性化多主体视频生成方面实现了最先进的性能。代码和模型均可在 https://jiazheng-xing.github.io/lumosx-home/ 获取。
引用
@article{arxiv.2603.20192,
title = {LumosX: Relate Any Identities with Their Attributes for Personalized Video Generation},
author = {Jiazheng Xing and Fei Du and Hangjie Yuan and Pengwei Liu and Hongbin Xu and Hai Ci and Ruigang Niu and Weihua Chen and Fan Wang and Yong Liu},
journal= {arXiv preprint arXiv:2603.20192},
year = {2026}
}
备注
ICLR 2026 Camera Ready Version. Code and Models: https://jiazheng-xing.github.io/lumosx-home/