DeLeaker:用于语义漏泄缓解的动态推断时重加权
计算机视觉与模式识别
2025-10-20 v1 人工智能
计算与语言
摘要
文本到图像(Text-to-Image, T2I)模型取得了快速进展,但仍然容易受到语义漏泄(semantic leakage)的威胁,即语义相关特征在不同实体之间意外传递。现有的缓解策略通常基于优化,或依赖于外部输入。我们引入 DeLeaker,一种轻量级、无优化的推理时方法,通过直接干预注意力图来缓解漏泄。在扩散过程中,DeLeaker 动态地对注意力图进行重加权,以抑制过度的跨实体相互作用,同时加强每个实体的身份识别。为支持系统化的评估,我们引入了 SLIM(Semantic Leakage in IMages),即第一个专门用于语义漏泄的数据集,包含 1,130 个人工验证的样本,涵盖多种场景,并配备了新的自动评估框架。实验表明,DeLeaker 在所有基线方法上均表现出色,即使这些基线方法被提供了外部信息,也能在不损害保真度或质量的前提下实现有效的漏泄缓解。这些结果凸显了注意力控制的价值,为更语义精确的 T2I 模型铺平了道路。
引用
@article{arxiv.2510.15015,
title = {DeLeaker: Dynamic Inference-Time Reweighting For Semantic Leakage Mitigation in Text-to-Image Models},
author = {Mor Ventura and Michael Toker and Or Patashnik and Yonatan Belinkov and Roi Reichart},
journal= {arXiv preprint arXiv:2510.15015},
year = {2025}
}