自动细粒度分割辅助的报告生成
计算机视觉与模式识别
2025-07-23 v1 机器学习
摘要
可靠的端到端临床报告生成一直是医学机器学习研究的长期目标。该流程的最终目标是减轻放射科医生的负担,并为临床医生或患者提供第二意见。因此,报告生成模型需要具备强大的通用性能和某种内在的 grounding 能力,以说服临床医生或患者报告的真实性。本文提出了 ASaRG(\textbf{A}utomatic \textbf{S}egmentation-\textbf{a}ssisted \textbf{R}eport \textbf{G}eneration),这是一种对流行的 LLaVA 架构的扩展,旨在解决上述问题。ASaRG 提议通过简单拼接将中间特征和由专职放射学模型创建的细粒度分割图融合到 LLaVA 的多模态投影层。通过少量额外参数,我们的方法在仅使用中间特征时比 LLaVA 基线实现了 +0.89\% 的 CE F1 分数提升(),而加入中间特征和细粒度分割图的组合则实现了 +2.77\% 的提升()。与两种利用分割的其他报告生成方法 COMG 和 ORID 相比,性能提升分别为 6.98\% 和 6.28\% 的 F1 分数。ASaRG 不与 LLaVA 架构的其他改动互斥, potentially 允许该方法与领域的其他进展相结合。最终,使用任意数量的分割图作为输入可证明地允许将报告元素追溯到相应的分割图,并验证评估的 groundedness。我们的代码将在稍后公开发布。
引用
@article{arxiv.2507.16623,
title = {Automatic Fine-grained Segmentation-assisted Report Generation},
author = {Frederic Jonske and Constantin Seibold and Osman Alperen Koras and Fin Bahnsen and Marie Bauer and Amin Dada and Hamza Kalisch and Anton Schily and Jens Kleesiek},
journal= {arXiv preprint arXiv:2507.16623},
year = {2025}
}