RAIGen:文本到图像生成模型中的稀有属性识别
计算机视觉与模式识别
2026-02-09 v1 机器学习
摘要
文本到图像扩散模型在生成质量方面取得了显著进步,但继承并放大了训练数据中的偏见,导致语义属性覆盖不均。先前工作有两种方式来解决此问题:封闭集方法针对预定义的公平性类别(如性别、种族),假设社会上显著的少数属性已知在先;开放集方法将任务定义为偏见识别,突出显示支配性输出的主要属性。两种方法都忽略了一项互补任务:发现数据分布中欠represent 的稀有或少数特征(社会、文化或风格),尽管这些特征仍编码在模型表示中。我们引入RAIGen,首次针对扩散模型实现无监督稀有属性发现。RAIGen利用Matryoshka稀疏自编码器和一种新颖的少数指标,该指标结合神经元激活频率与语义独特性,以识别可解释的神经元,其前激活图像揭示了欠represent 的属性。实验表明,RAIGen在Stable Diffusion中发现超越固定公平性类别的属性,能够扩展到更大模型如SDXL,支持跨架构的系统性审计,并在生成期间实现对稀有属性的有针对性放大。
引用
@article{arxiv.2602.06806,
title = {RAIGen: Rare Attribute Identification in Text-to-Image Generative Models},
author = {Silpa Vadakkeeveetil Sreelatha and Dan Wang and Serge Belongie and Muhammad Awais and Anjan Dutta},
journal= {arXiv preprint arXiv:2602.06806},
year = {2026}
}