AnchorDiff:基于拓扑感知的掩码扩散与置信度重写用于放射学报告生成
人工智能
2026-05-19 v1
摘要
放射学报告生成(RRG)旨在自动生成来自医学影像的临床准确文本报告。现有方法主要依赖自回归(AR)语言模型,其因果依赖结构限制生成为单向左到右过程。此范式可引发序列偏置,模型倾向遵循典型 token 顺序和高频报告模板,而非完全基于图像特定证据进行生成。本文提出 AnchorDiff,即首个用于 RRG 的掩码扩散框架,集成来源于知识图谱的临床锚点于扩散语言建模。通过利用双向上下文和迭代细化,AnchorDiff 缓解了固定顺序自回归解码的局限性。具体而言,我们引入拓扑感知训练策略,利用 RadGraph 派生实体层次结构为临床重要 token 区分不同的掩码保护和损失权重。我们进一步设计了推断时重写策略,通过扰动测试检测不稳定已提交 token,并在去噪期间选择性修订。在 MIMIC-CXR 和 MIMIC-RG4 数据集上的大规模实验表明,AnchorDiff 实现了最新(SOTA)性能,展示了针对放射学报告生成的临床锚点掩码扩散的有效性。
引用
@article{arxiv.2605.17071,
title = {AnchorDiff: Topology-Aware Masked Diffusion with Confidence-based Rewriting for Radiology Report Generation},
author = {Shiying Yu and Jielei Wang and Guoming Lu},
journal= {arXiv preprint arXiv:2605.17071},
year = {2026}
}