通过概念-提示绑定组合图像与视频中的概念
计算机视觉与模式识别
2026-03-17 v2 人工智能
多媒体
摘要
视觉概念组合旨在将图像和视频中的不同元素整合为单一、连贯的视觉输出,但在从视觉输入中准确提取复杂概念以及灵活组合来自图像和视频的概念方面仍存在不足。我们提出 Bind & Compose,一种单样本方法,通过将视觉概念与相应的提示令牌绑定,并从各种来源组合绑定令牌来构成目标提示,从而实现灵活视觉概念组合。该方法采用分层绑定结构,在扩散变换器(Diffusion Transformers)中进行交叉注意力条件化,以将视觉概念编码到相应的提示令牌中,实现对复杂视觉概念的准确分解。为提高概念-令牌绑定精度,我们设计了多样化-吸收机制(Diversify-and-Absorb Mechanism),利用额外的吸收令牌消除训练过程中多样化提示带来的概念无关细节的影响。为增强图像与视频概念之间的兼容性,我们提出时间解耦策略(Temporal Disentanglement Strategy),通过双分支绑定结构将视频概念的训练过程解耦为两个阶段以进行时间建模。评估结果表明,我们的方法在概念一致性、提示保真度和运动质量方面优于现有方法,为视觉创意开辟了新的可能性。
引用
@article{arxiv.2512.09824,
title = {Composing Concepts from Images and Videos via Concept-prompt Binding},
author = {Xianghao Kong and Zeyu Zhang and Yuwei Guo and Zhuoran Zhao and Songchun Zhang and Anyi Rao},
journal= {arXiv preprint arXiv:2512.09824},
year = {2026}
}
备注
CVPR 2026. Project page: https://refkxh.github.io/BiCo_Webpage/