多模态图像-文本匹配改进基于检索的胸部X光报告生成
计算与语言
2023-05-04 v2 人工智能
计算机视觉与模式识别
摘要
自动生成临床准确的放射学报告可改善患者照护。以往依赖图像描述模型的报告生成方法常因缺乏相关领域知识而生成不连贯且错误的文本,而基于检索的尝试则频繁检索到与输入图像无关的报告。本工作中,我们提出对比X光报告匹配(X-REM),一种新颖的基于检索的放射学报告生成模块,其利用图像-文本匹配分数来衡量胸部X光图像与放射学报告的相似度以进行报告检索。我们观察到,用语言-图像模型计算图像-文本匹配分数能有效捕捉图像与文本间的细粒度交互,而使用余弦相似度时常丢失此种交互。X-REM在自然语言与临床指标上均优于多种先前的放射学报告生成模块。对生成报告的人工评估表明,与基线检索方法相比,X-REM增加了零错误报告的数量并降低了平均错误严重程度。我们的代码见:https://github.com/rajpurkarlab/X-REM
引用
@article{arxiv.2303.17579,
title = {Multimodal Image-Text Matching Improves Retrieval-based Chest X-Ray Report Generation},
author = {Jaehwan Jeong and Katherine Tian and Andrew Li and Sina Hartung and Fardad Behzadi and Juan Calle and David Osayande and Michael Pohlen and Subathra Adithan and Pranav Rajpurkar},
journal= {arXiv preprint arXiv:2303.17579},
year = {2023}
}