论图像编码在自动化胸部X光报告生成中的重要性
计算机视觉与模式识别
2022-11-28 v1 人工智能
摘要
胸部X光因其可及性与有效性而成为最普及的医学影像模态之一。然而,能够解读这些图像并诊断患者病情的训练有素放射科医生长期短缺。因此,自动化放射学报告生成在临床实践中可成为非常有用的工具。典型的报告生成流程包含两个主要步骤:(i)将图像编码至潜空间;(ii)基于潜图像嵌入生成报告文本。许多现有报告生成技术使用标准卷积神经网络(CNN)架构进行图像编码,随后使用基于Transformer的解码器生成医学文本。在大多数情况下,CNN与解码器以端到端方式联合训练。在本工作中,我们主要聚焦于理解编码器与解码器组件的相对重要性。为此,我们在大规模MIMIC-CXR数据集上,结合三种不同解码器分析了四种不同的图像编码方法:直接编码、细粒度编码、基于CLIP的编码和基于Cluster-CLIP的编码。在这些编码器中,cluster CLIP视觉编码器是一种旨在生成更具判别性与可解释表示的新方法。基于CLIP的编码器在NLP指标上产生与传统基于CNN的编码器相当的结果,而细粒度编码在NLP与临床准确性指标上均优于所有其他编码器,从而验证了图像编码器有效提取语义信息的重要性。GitHub仓库:https://github.com/mudabek/encoding-cxr-report-gen
引用
@article{arxiv.2211.13465,
title = {On the Importance of Image Encoding in Automated Chest X-Ray Report Generation},
author = {Otabek Nazarov and Mohammad Yaqub and Karthik Nandakumar},
journal= {arXiv preprint arXiv:2211.13465},
year = {2022}
}