Nested Attention:面向概念个性化的语义感知注意力值
计算机视觉与模式识别
2025-01-03 v1
摘要
针对文本到图像模型在不同场景和风格下生成特定主题图像的个性化问题,当前方法面临在身份保持与输入文本提示对齐之间取得平衡的挑战。一些方法依赖单一文本标记表示主题,导致表达受限;而另一些方法采用更丰富的表示方式,却破坏模型的先验设定,影响提示对齐。在本工作中,我们引入了 Nested Attention,即一种新型机制,将丰富且富有表现力的图像表示注入模型现有的跨注意力层中。我们的核心思想是生成查询依赖的主题值,这些值来源于学习为生成图像中每个区域选择相关主题特征的嵌套注意力层。我们将这些嵌套层整合到基于编码器的个性化方法中,展示它们如何在遵循输入文本提示的同时实现高度的身份保持。我们的做法是通用的,可在 various 领域进行训练。此外,其先验保持特性使我们能够将来自不同领域的多个个性化主题在单张图像中进行组合。
引用
@article{arxiv.2501.01406,
title = {nnY-Net: Swin-NeXt with Cross-Attention for 3D Medical Images Segmentation},
author = {Haixu Liu and Zerui Tao and Wenzhen Dong and Qiuzhuang Sun},
journal= {arXiv preprint arXiv:2501.01406},
year = {2025}
}
备注
MICCAI