无需人类反馈的胸部X光异常可视化解释与理解框架
计算机视觉与模式识别
2025-06-26 v2 计算与语言
摘要
随着人工智能(AI)在医疗领域的日益重要,解释性和可信赖性模型的需求愈发紧迫。当前的胸部X光(CXR)报告生成系统往往缺乏无需专家监督的输出验证机制,导致可靠性和可解释性存疑。为此,我们提出一种新型多模态框架,以增强AI生成医学报告的语义对齐性和局化准确性。该框架集成两个关键模块:短语定位模型(Phrase Grounding Model),其基于文本提示识别并定位CXR图像中的病灶;文本到图像扩散模块(Text-to-Image Diffusion Module),其从提示生成合成CXR图像,同时保持解剖学忠实性。通过比较原始图像与生成图像的特征,我们引入双重评分体系:一个评分衡量局化准确性,另一个评估语义一致性。该方法在病灶局化和文本到图像对齐方面显著优于现有方法,实现了最新成果。短语定位与扩散模型的集成,以及双重评分评估体系,为验证报告质量提供了可靠机制,为医学影像领域更可信、更透明的AI应用铺平了道路。
引用
@article{arxiv.2501.17726,
title = {VICCA: Visual Interpretation and Comprehension of Chest X-ray Anomalies in Generated Report Without Human Feedback},
author = {Sayeh Gholipour Picha and Dawood Al Chanti and Alice Caplier},
journal= {arXiv preprint arXiv:2501.17726},
year = {2025}
}