中文

视觉幻觉:定义、量化与规范性补救措施

人工智能 2024-04-02 v2

摘要

幻觉问题的日益严重或许是负责任人工智能发展中最重大的障碍。近年来,大量研究集中于检测和缓解大型语言模型(LLMs)中的幻觉。然而,值得注意的是,幻觉在视觉-语言模型(VLMs)中也相当普遍。本文基于两项任务:i) 图像描述生成,和 ii) 视觉问答(VQA),对 VLM 幻觉的特征进行了细粒度论述。我们描绘了视觉幻觉的八种细粒度取向:i) 情境猜测,ii) 身份不一致,iii) 地理错误,iv) 视觉错觉,v) 性别异常,vi) VLM 作为分类器,vii) 错误读取,以及 viii) 数值差异。我们构建了视觉幻觉诱发数据集(VHILT),这是一个公开可用的数据集,包含使用八种 VLM 在描述生成和 VQA 两项任务上生成的 2000 个样本,并附带了针对上述类别的人工标注。

关键词

引用

@article{arxiv.2403.17306,
  title  = {Visual Hallucination: Definition, Quantification, and Prescriptive Remediations},
  author = {Anku Rani and Vipula Rawte and Harshad Sharma and Neeraj Anand and Krishnav Rajbangshi and Amit Sheth and Amitava Das},
  journal= {arXiv preprint arXiv:2403.17306},
  year   = {2024}
}