面向大型视觉语言模型的胃肠镜图像分析的误识感知多模态基准
计算机视觉与模式识别
2025-06-24 v2 机器学习
摘要
视觉语言模型 (VLM) 在医学领域日益受到关注,正在缩小医学图像与临床语言之间的鸿沟。现有的 VLM 能够显著优异地理解医学图像和文本查询,生成详细、描述性的诊断性医学报告。然而,误识感——生成内容与视觉信息不一致的倾向——仍是 VLM 中的重要问题,在医学领域尤其具有严重后果。为促进 VLM 在胃肠镜 (GI) 图像分析和误识感研究方面的发展,我们构建了一个多模态 GI 数据集:Gut-VLM。该数据集采用两阶段流程创建:首先,使用 ChatGPT 生成 Kvasir-v2 图像的描述性医学报告,这会引入一些误识或不正确的文本;在第二阶段,医学专家系统性地审查这些报告,识别并纠正潜在的不准确之处,以确保高质量、临床可靠的标注。与传统仅包含描述性文本的数据集不同,我们的数据集还包含标识误识句子及其对应纠正内容的标签。减少 VLM 误识感的常见方法是对小规模、特定问题的数据集进行微调。然而,我们的做法则不同。我们并非仅为生成文本报告而微调 VLM,而是将其微调以检测并纠正误识,这是我们称为误识感感知微调的方法。我们的结果表明,这种方法优于仅为描述性报告生成进行微调。此外,我们在多个指标上对最新 SOTA VLM 进行了广泛评估,建立了基准。GitHub 仓库:https://github.com/bhattarailab/Hallucination-Aware-VLM。
引用
@article{arxiv.2505.07001,
title = {Hallucination-Aware Multimodal Benchmark for Gastrointestinal Image Analysis with Large Vision-Language Models},
author = {Bidur Khanal and Sandesh Pokhrel and Sanjay Bhandari and Ramesh Rana and Nikesh Shrestha and Ram Bahadur Gurung and Cristian Linte and Angus Watson and Yash Raj Shrestha and Binod Bhattarai},
journal= {arXiv preprint arXiv:2505.07001},
year = {2025}
}
备注
Accepted at MICCAI 2025