中文

MedVH:面向医学场景中大型视觉语言模型幻觉的系统评估

计算机视觉与模式识别 2024-07-04 v1 人工智能

摘要

大型视觉语言模型 (LVLMs) 近期在自然图像和文本数据上的各类任务中取得优异性能,激发了大量针对 LVLMs 微调和训练的研究。尽管如此,针对这些模型在较小数据集上微调后对幻觉鲁性的研究仍寥寥无几。本研究引入了一个新的基准数据集,医学视觉幻觉测试 (MedVH),用于评估特定领域 LVLMs 的幻觉。MedVH 包含五个任务,用于在医学语境下评估 LVLMs 的幻觉,包括对文本和视觉输入的全面理解任务,以及长文本响应生成任务。我们的广泛实验显示,尽管医学 LVLMs 在标准医学任务上表现出色,但它们对幻觉尤其敏感,往往比通用模型更易产生幻觉,这引发了对这些特定领域模型可靠性的重大担忧。对于 LVLMs 在实际应用中真正发挥价值,必须不仅准确整合医学知识,还能保持稳健的推理能力以防止幻觉。我们的工作为未来这些研究的评估指明了道路。

关键词

引用

@article{arxiv.2407.02730,
  title  = {MedVH: Towards Systematic Evaluation of Hallucination for Large Vision Language Models in the Medical Context},
  author = {Zishan Gu and Changchang Yin and Fenglin Liu and Ping Zhang},
  journal= {arXiv preprint arXiv:2407.02730},
  year   = {2024}
}