MaskAttn-SDXL:可控制的区域级文本到图像生成
计算机视觉与模式识别
2026-05-19 v2 机器学习
摘要
扩散模型在文本到图像生成中取得了强劲结果,但随着提示变得更加结构化和多对象,仍存在重要局限。在架构方面,U-Net 主干网络高效且稳定,但其局部性使全局协调更加困难,而基于 Transformer 的扩散模型改善了全局交互,但计算和内存成本显著提高。与此同时,组合可靠性仍然薄弱:模型经常跨对象混合属性、违反空间关系或遗漏请求实体,而这些错误无法由 FID 或基于 CLIP 的分数等全局指标可靠地反映。为在不改变 SDXL 流水线的前提下解决这些问题,我们提出了 MaskAttn-SDXL,一个即插即用模块,在 softmax 之前将基于 token 的空间门控注入交叉注意力对数几率中。门控操作稀疏化了 token 到位置的交互,以抑制无关绑定,同时保留预训练主干网络和标准采样过程,无需外部监督或推理时编辑。
引用
@article{arxiv.2509.15357,
title = {MaskAttn-SDXL: Controllable Region-Level Text-To-Image Generation},
author = {Yu Chang and Jiahao Chen and Anzhe Cheng and Paul Bogdan},
journal= {arXiv preprint arXiv:2509.15357},
year = {2026}
}
备注
Accepted to the 2026 International Joint Conference on Neural Networks (IJCNN 2026)