中文

GELDA:一种用于揭示数据集中视觉偏差的生成式语言标注框架

计算机视觉与模式识别 2023-12-01 v1

摘要

偏差分析是为训练和评估计算机视觉模型创建公平数据集过程中的关键步骤。数据集分析的瓶颈在于标注,通常需要进行:(1) 指定与数据集领域相关的属性列表;(2) 对每对图像-属性进行分类。虽然第二步在自动化方面取得了快速进展,但第一步仍以人为中心,需要实验者编制领域内属性列表。然而,实验者的预见性可能有限,从而导致标注“盲点”,进而可能造成下游数据集分析的缺陷。为此,我们提出 GELDA,一种近乎自动的框架,利用大型生成式语言模型(LLM)为某一领域提出并标注各种属性。GELDA 接受用户定义的领域描述(例如“一张鸟的照片”、“一张客厅的照片”),并使用 LLM 分层生成属性。此外,GELDA 使用 LLM 来决定使用一组视觉-语言模型(VLM)中的哪一个对图像中的每个属性进行分类。在真实数据集上的结果表明,GELDA 能够生成准确且多样的视觉属性建议,并揭示诸如类标签与背景特征之间的混淆等偏差。在合成数据集上的结果表明,GELDA 可用于评估文本到图像扩散模型和生成对抗网络(GAN)的偏差。总体而言,我们表明虽然 GELDA 的准确度尚不足以取代人类标注者,但它可以作为一种补充工具,以廉价、低投入和灵活的方式帮助人类分析数据集。

关键词

引用

@article{arxiv.2311.18064,
  title  = {GELDA: A generative language annotation framework to reveal visual biases in datasets},
  author = {Krish Kabra and Kathleen M. Lewis and Guha Balakrishnan},
  journal= {arXiv preprint arXiv:2311.18064},
  year   = {2023}
}

备注

21 pages, 15 figures, 9 tables