中文

放射学报告生成的校准置信度表达

计算与语言 2026-04-01 v1

摘要

大型视觉语言模型(LVLMs)在放射学报告生成中部署安全性不仅需要准确的预测,还需要临床可解释的指示,表明何时应该仔细审查输出,从而实现针对性放射科医师验证,减少幻觉发现影响临床决策的风险。一种直观的方法是 verbalized confidence,即模型明确表达其确定性。然而,当前最先进的语言模型往往会高估置信度,而关于多模态设置(如放射学报告生成)中校准的研究则有限。为此,我们引入ConRad(放射学报告的置信度校准),这是一种用于微调医学LVLMs以产生校准的 verbalized confidence 估计的强化学习框架,同时生成放射学报告。我们研究了两种设置:一种是单个报告级别的置信度得分,另一种是为每个声明分配置信度的句子级别变体。两种方法都使用基于对数评分规则的奖励函数进行训练,该奖励函数通过惩罚不校准来激励诚实自我评估,并在奖励最大化下保证最佳校准。实验结果表明,ConRad显著改进了校准效果,并优于现有方法。在临床评估中,我们显示ConRad的报告级别得分与医师的判断高度一致。通过突出显示完整报告或低置信度声明进行针对性审查,ConRad可以支持AI辅助报告生成在临床中的更安全集成。

关键词

引用

@article{arxiv.2603.29492,
  title  = {Calibrated Confidence Expression for Radiology Report Generation},
  author = {David Bani-Harouni and Chantal Pellegrini and Julian Lüers and Su Hwan Kim and Markus Baalmann and Benedikt Wiestler and Rickmer Braren and Nassir Navab and Matthias Keicher},
  journal= {arXiv preprint arXiv:2603.29492},
  year   = {2026}
}