MvKeTR:基于多视角感知与知识增强的胸部 CT 报告生成
计算机视觉与模式识别
2025-06-27 v3 人工智能
摘要
CT 报告生成(CTRG)旨在自动为 3D 体积生成诊断报告,减轻临床医生的负担并提升患者护理水平。尽管临床价值明显,现有研究未能有效地整合来自多个解剖视角的诊断信息,亦缺乏准确可靠诊断所必需的相关临床知识。为此,我们提出一种新型的多视角感知知识增强变换器(MvKeTR),以模拟临床医生的诊断工作流程。类似于放射科医生首先从多个平面检查 CT 扫描,本文提出一种具备视角感知注意力机制的多视角感知聚合器(MVPA),有效综合来自多个解剖视角的诊断信息。随后,借鉴放射科医生进一步查阅相关临床记录以指导诊断决策的做法,设计了跨模态知识增强器(CMKE),用于检索与查询体积最相似的报告,以将领域知识纳入诊断流程。此外,与传统多层感知器(MLP)不同,我们采用Kolmogorov-Arnold 网络(KANs)作为两个模块的基本构建块,该网络在参数效率更高,谱偏差更小,能够更好地捕捉 CT 解读中关键的高频成分,同时缓解过拟合问题。对公开的 CTRG-Chest-548 数据集进行的大量实验表明,我们的方法在几乎所有指标上均优于先前的研究型(SOTA)模型。代码已公开于 https://github.com/xiweideng/MvKeTR。
引用
@article{arxiv.2411.18309,
title = {MvKeTR: Chest CT Report Generation with Multi-View Perception and Knowledge Enhancement},
author = {Xiwei Deng and Xianchun He and Jianfeng Bao and Yudan Zhou and Shuhui Cai and Congbo Cai and Zhong Chen},
journal= {arXiv preprint arXiv:2411.18309},
year = {2025}
}
备注
Accepted for publication in IEEE Journal of Biomedical and Health Informatics