中文

基于可学习检索的视觉-文本对齐与融合用于放射科报告生成

统计方法学 2025-07-11 v1 图像与视频处理

摘要

自动化放射科报告生成对于提高诊断效率和减少医疗专业人员的工作量至关重要。然而,现有方法面临诸多挑战,如疾病类别不平衡和跨模态融合不足。为此,我们提出了可学习检索增强的视觉-文本对齐与融合(REVTAF, Learnable Retrieval Enhanced Visual-Text Alignment and Fusion)框架,有效解决报告生成中的类别不平衡问题和视觉-文本融合问题。REVTAF包含两个核心组件:(1)可学习检索增强器(Learnable Retrieval Enhancer, LRE),其利用超球面空间中的语义层次结构和批内上下文通过排序-based 指标进行检索。LRE能够自适应检索最相关的参考报告,尤其针对 underrepresented(尾部)类别输入增强图像表征;(2)细粒度视觉-文本对齐与融合策略,确保多源跨注意力图在精确对齐方面的一致性。该组件进一步采用最优传输(based optimal transport)的跨注意力机制,用于动态集成与任务相关的文本知识以提高报告生成质量。通过将自适应检索与多源对齐融合结合,REVTAF实现了在弱图像-报告级别监督下的细粒度视觉-文本集成,同时有效缓解数据不平衡问题。实验结果表明,REVTAF在 MIMIC-CXR 数据集上优于最新方法平均提升7.4%,在 IU X-Ray 数据集上提升2.9%。与主流多模态大语言模型(如GPT系列模型)的比较进一步凸显了其在放射科报告生成中的优势。https://github.com/banbooliang/REVTAF-RRG

关键词

引用

@article{arxiv.2507.07568,
  title  = {Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation},
  author = {Qin Zhou and Guoyan Liang and Xindi Li and Jingyuan Chen and Wang Zhe and Chang Yao and Sai Wu},
  journal= {arXiv preprint arXiv:2507.07568},
  year   = {2025}
}

备注

10 pages,3 figures, conference