中文

从描述丰富性到偏差:揭示生成式图像描述丰富化的暗面

计算机视觉与模式识别 2024-06-21 v1

摘要

大型语言模型(LLMs)提升了视觉语言模型为图像生成描述的能力。这种生成式方法可使文本描述更具描述性,提高与视觉语境的对齐度。然而,尽管许多研究聚焦于生成式描述丰富化(GCE)的积极影响,但其潜在的负面影响是否也存在?我们从“性别偏见”和“幻觉”两个角度对比标准格式描述与最新 GCE 处理过程,发现丰富化描述在性别偏见和幻觉方面均显著增加。进一步实验表明,基于这些丰富化描述训练的模型将性别偏见放大平均 30.9%,幻觉增加 59.5%。本研究作为警示,反对将描述变得更具描述性的趋势。

关键词

引用

@article{arxiv.2406.13912,
  title  = {From Descriptive Richness to Bias: Unveiling the Dark Side of Generative Image Caption Enrichment},
  author = {Yusuke Hirota and Ryo Hachiuma and Chao-Han Huck Yang and Yuta Nakashima},
  journal= {arXiv preprint arXiv:2406.13912},
  year   = {2024}
}