利用眼注模式增强基于视觉和语言模型的胸部 X 光分析中的人机交互
计算机视觉与模式识别
2024-04-04 v1 人工智能
计算与语言
摘要
计算机辅助诊断的最新进展在医学影像任务中展现出在胸部 X 光分析方面的前景表现。然而,这些模型与放射科医师之间的交互主要局限于输入图像。本工作提出一种新方法,通过将眼注数据整合到文本提示中,增强了基于视觉语言模型(VLM)的胸部 X 光分析中的人机交互。我们的做法利用从眼注数据生成的热图,将其叠加到医学图像上,以突出放射科医师在胸部 X 光评估期间注意力集中的区域。我们在视觉问答、胸部 X 光报告自动化、错误检测和差别诊断等任务中评估了该方法。我们的结果表明,包括眼注信息显著提高了胸部 X 光分析的准确性。也确认了眼注对微调的影响,因为在除视觉问答之外的所有任务中,它都优于其他医学 VLM。本工作标志着利用 VLM 的能力和放射科医师的专业知识来提高医学影像中 AI 模型能力的潜力,为以以人为中心的方式开展计算机辅助诊断铺平了新路径。
引用
@article{arxiv.2404.02370,
title = {Enhancing Human-Computer Interaction in Chest X-ray Analysis using Vision and Language Model with Eye Gaze Patterns},
author = {Yunsoo Kim and Jinge Wu and Yusuf Abdulle and Yue Gao and Honghan Wu},
journal= {arXiv preprint arXiv:2404.02370},
year = {2024}
}
备注
Under review