中文

ALOHa:图像描述模型中幻觉的新度量

计算机视觉与模式识别 2024-04-04 v1 人工智能 计算与语言 机器学习

摘要

尽管近期在用于视觉描述的多模态预训练方面取得了进展,但最先进的模型仍然会产生包含错误的描述,例如凭空产生场景中不存在的物体。现有的针对物体幻觉的著名度量指标 CHAIR 仅限于一组固定的 MS COCO 物体及其同义词。在这项工作中,我们提出了一种现代化的开放词汇度量指标 ALOHa,它利用大语言模型 (LLM) 来衡量物体幻觉。具体而言,我们使用 LLM 从候选描述中提取可定位的物体,衡量它们与来自描述和物体检测的参考物体之间的语义相似度,并使用匈牙利匹配来生成最终的幻觉分数。我们表明,在为幻觉标注的 MS COCO Captions 新黄金标准子集 HAT 上,ALOHa 比 CHAIR 正确识别出多 13.6% 的幻觉物体;在物体超出 MS COCO 类别的 nocaps 上,则多识别出 30.8%。我们的代码可在 https://davidmchan.github.io/aloha/ 获取。

关键词

引用

@article{arxiv.2404.02904,
  title  = {ALOHa: A New Measure for Hallucination in Captioning Models},
  author = {Suzanne Petryk and David M. Chan and Anish Kachinthaya and Haodi Zou and John Canny and Joseph E. Gonzalez and Trevor Darrell},
  journal= {arXiv preprint arXiv:2404.02904},
  year   = {2024}
}

备注

To appear at NAACL 2024