中文

面向LVLM放射科报告的句子级过程奖励模型

计算与语言 2025-10-28 v1 人工智能

摘要

利用大型视觉语言模型(LVLMs)自动生成放射科报告具有巨大潜力,但这些模型常产生临床关键性幻觉,构成严重风险。现有幻觉检测方法常缺乏必要的句子级细粒度或对不同LVM生成器的鲁棒性。我们引入一种新方法:为此视觉语言任务定制的句子级过程奖励模型(PRM)。我们的PRM根据临床背景和前导文本预测每个生成句子的客观正确性。经过在MIMIC-CXR上进行的弱监督标签微调后,一个轻量级0.5B参数的PRM在对一种LVM输出的验证中,分别在 Matthews相关系数和 AUROC 上分别提升了7.5%和1.8%。与依赖内部模型状态的方法不同,我们的PRM对未见的LVM表现出强大的泛化能力。我们进一步展示其实际用途:PRM评分有效过滤低质量报告,使F1-CheXbert分数提高4.5%(丢弃最差10%的报告)。此外,当在MIMIC-CXR测试集上采用加权最佳N选择过程指导时,我们的PRM在临床指标上分别实现了F1-CheXbert提升7.4%和BERTScore提升0.6%。这些结果表明,一个轻量级、上下文感知的PRM为临床LVLMs提供了无需访问内部激活的模型无关安全层。

关键词

引用

@article{arxiv.2510.23217,
  title  = {Process Reward Models for Sentence-Level Verification of LVLM Radiology Reports},
  author = {Alois Thomas and Maya Varma and Jean-Benoit Delbrouck and Curtis P. Langlotz},
  journal= {arXiv preprint arXiv:2510.23217},
  year   = {2025}
}