暴露深层生成模型中的多样性偏差:统计来源及多样性误差的纠正
机器学习
2026-02-17 v1 人工智能
计算机视觉与模式识别
最优化与控制
摘要
深层生成模型在生成高质量样本方面取得了巨大成功,成为机器学习应用的核心工具。超越样本质量的一个重要且尚未系统研究的问题是,训练得到的生成模型是否忠实地捕捉底层数据分布的多样性。本文通过直接将现代生成模型生成的样本多样性与从目标数据分布中抽取的测试样本多样性进行比较,使用最近提出的无参考基于熵的多样性评分 Vendi 和 RKE 来回答这一问题。我们在多个基准数据集上发现,测试数据始终比生成样本获得显著更高的 Vendi 和 RKE 多样性评分,表明现代生成模型中存在系统性的向下多样性偏差。为理解这一偏差的来源,我们分析了基于熵的多样性评分的有限样本行为,指出其预期值随样本量的增加而增大,暗示从有限训练集中估计的多样性可能本质上低估了真实分布的多样性。因此,优化生成器以最小化对经验数据分布的偏差将导致多样性损失。最后,我们讨论了基于 Vendi 和 RKE 的潜在多样性感知正则化和指导策略作为缓解这一偏差的原则方法,并提供实证证据表明这些方法可能提升结果。
引用
@article{arxiv.2602.14682,
title = {Exposing Diversity Bias in Deep Generative Models: Statistical Origins and Correction of Diversity Error},
author = {Farzan Farnia and Mohammad Jalali and Azim Ospanov},
journal= {arXiv preprint arXiv:2602.14682},
year = {2026}
}