中文

解剖注意力对齐表示用于放射科报告生成

计算机视觉与模式识别 2025-05-13 v1

摘要

自动化放射科报告生成(Radiology report generation, RRG)旨在生成详细的医学图像描述,减轻放射科医生的工作负担并提高高质量诊断服务的可及性。现有编码器-解码器模型仅依赖从原始输入图像中提取的视觉特征,可能限制对空间结构和语义关系的理解,常导致生成文本效果不佳。为此,我们提出解剖注意力对齐网络(Anatomical Attention Alignment Network, A3Net),一种通过构建超视觉表征来增强视觉-文本理解的框架。我们的方法将解剖结构知识词典与补丁级视觉特征集成,使模型能够有效地将图像区域与其对应的解剖实体关联。这种结构化表征提高了语义推理、可解释性和跨模态对齐,最终提升了生成报告的准确性和临床相关性。在 IU X-Ray 和 MIMIC-CXR 数据集上的实验结果表明,A3Net 在视觉感知和文本生成质量方面均显著优于现有方法。我们的代码已在 GitHub 上公开。\href{https://github.com/Vinh-AI/A3Net}{GitHub}

关键词

引用

@article{arxiv.2505.07689,
  title  = {Anatomical Attention Alignment representation for Radiology Report Generation},
  author = {Quang Vinh Nguyen and Minh Duc Nguyen and Thanh Hoang Son Vo and Hyung-Jeong Yang and Soo-Hyung Kim},
  journal= {arXiv preprint arXiv:2505.07689},
  year   = {2025}
}