医学视觉问答中的幻觉基准
计算与语言
2024-04-04 v2 人工智能
计算机视觉与模式识别
摘要
近期大型语言与视觉模型(LLVMs)在视觉问答(VQA),特别是其在医学领域(Med-VQA)的应用上取得的成功,展示了实现有效医疗视觉助手的巨大潜力。然而,这些模型尚未在临床环境中的幻觉现象方面得到广泛测试。在此,我们创建了一个由医学图像与问答对组成的幻觉基准,并对当前最先进的模型进行了全面评估。该研究深入分析了当前模型的局限性,并揭示了各种提示策略的有效性。
引用
@article{arxiv.2401.05827,
title = {Hallucination Benchmark in Medical Visual Question Answering},
author = {Jinge Wu and Yunsoo Kim and Honghan Wu},
journal= {arXiv preprint arXiv:2401.05827},
year = {2024}
}
备注
Accepted to ICLR 2024 Tiny Papers(Notable)