中文

大型视觉-语言模型中幻觉现象的评估与分析

机器学习 2023-10-11 v3 人工智能 计算与语言 计算机视觉与模式识别

摘要

大型视觉-语言模型(LVLMs)近期取得了显著成功。然而,LVLMs 仍受幻觉问题困扰,这在许多场景中限制了其实用性。幻觉是指 LVLMs 的回复中存在视觉输入中并不包含的信息,这带来了实质性后果的潜在风险。目前研究 LVLMs 中幻觉评估的工作有限。本文提出基于大型语言模型的幻觉评估(HaELM),一种基于 LLM 的幻觉评估框架。HaELM 达到了约 95% 可比于 ChatGPT 的性能,并具有低成本、可复现、隐私保护及本地部署等额外优势。借助 HaELM,我们评估了当前 LVLMs 中的幻觉。此外,我们分析了导致 LVLMs 中幻觉的因素,并提供了有助于缓解幻觉问题的建议。我们的训练数据与人工标注幻觉数据将很快公开。

关键词

引用

@article{arxiv.2308.15126,
  title  = {Evaluation and Analysis of Hallucination in Large Vision-Language Models},
  author = {Junyang Wang and Yiyang Zhou and Guohai Xu and Pengcheng Shi and Chenlin Zhao and Haiyang Xu and Qinghao Ye and Ming Yan and Ji Zhang and Jihua Zhu and Jitao Sang and Haoyu Tang},
  journal= {arXiv preprint arXiv:2308.15126},
  year   = {2023}
}

备注

11 pages, 5 figures