扩散模型中的角色偏差:通过中间分解进行诊断与缓解
计算机视觉与模式识别
2025-11-11 v3
摘要
文本到图像(T2I)扩散模型展现出令人印象深刻的照片级图像生成能力,但在组合图像生成方面仍存在困难。在本工作中,我们引入 RoleBench,一个专注于评估基于动作的关系中组合泛化能力的基准(如"mouse chasing cat")。我们表明,最先进的 T2I 模型和组合生成方法始终倾向于频繁出现的反向关系(即"cat chasing mouse"),我们将这一现象称为角色坍缩。相关研究将此归因于模型的架构局限或数据中的表示不足。我们的关键洞察揭示,虽然模型在罕见组合上失败而其逆关系常见时,它们能够成功生成类似的中间组合(如"mouse chasing boy"),这表明该限制不仅源于罕见组合的缺失,也源于频繁对应组合的存在。受此启发,我们假设方向性分解可以逐步缓解角色坍缩。我们通过 ReBind 进行验证,这是一个轻量级框架,利用精心选择的主动/被动中间组合来教授角色绑定。实验表明,通过简单微调的中间组合可以显著减少角色坍缩,与最先进方法相比,人类对 ReBind 的偏好超过 78%。我们的发现揭示了分布不对称在组合失败中的作用,并为提高泛化能力提供了一条简单有效的路径。
引用
@article{arxiv.2503.10037,
title = {Role Bias in Diffusion Models: Diagnosing and Mitigating through Intermediate Decomposition},
author = {Sina Malakouti and Adriana Kovashka},
journal= {arXiv preprint arXiv:2503.10037},
year = {2025}
}