中文

面向扩散模型的高效文本引导卷积适配器

计算机视觉与模式识别 2026-02-23 v2

摘要

我们介绍了 Nexus Adapters,这是一种新颖的文本引导式高效适配器,用于结构保持条件生成(SPCG)框架。最近的结构保持方法通过使用基础模型进行提示条件处理,同时使用适配器处理结构输入(如草图或深度图),在条件图像生成中取得了令人鼓舞的成果。但这些方法效率极低,有时甚至需要适配器的参数量与基础架构相同。由于扩散模型本身计算成本高昂,双倍参数的增加效率极差。在这些方法中,适配器并不了解输入提示;因此,它仅对结构输入最优,而不针对输入提示。为克服上述挑战,我们提出了两种高效适配器,Nexus Prime 和 Slim,这两种适配器均由提示和结构输入驱动。每个 Nexus 块集成了跨注意力机制,以实现丰富的多模态条件处理。因此,提出的适配器对输入提示有更好的理解,同时保持结构。我们对提出的模型进行了大量实验,证明 Nexus Prime 适配器仅需比基线 T2I-Adapter 增加 800 万参数,即可显著提升性能。此外,我们还引入了一个轻量级 Nexus Slim 适配器,比 T2I-Adapter 少 1800 万参数,仍实现了最先进的效果。代码:https://github.com/arya-domain/Nexus-Adapters

关键词

引用

@article{arxiv.2602.14514,
  title  = {Efficient Text-Guided Convolutional Adapter for the Diffusion Model},
  author = {Aryan Das and Koushik Biswas and Swalpa Kumar Roy and Badri Narayana Patro and Vinay Kumar Verma},
  journal= {arXiv preprint arXiv:2602.14514},
  year   = {2026}
}

备注

Accepted in WACV 2026