中文

通过轨迹积分反馈调节解剖结构感知奖励用于体积 CT 分析

计算机视觉与模式识别 2026-05-21 v1 人工智能

摘要

医学视觉-语言模型(VLM) rapidly advanced 作为通用多模态助手,但其在 3D CT 分析中的部署仍受制于优化目标与临床严谨性之间的持久不匹配。当前的强化学习(RL)范式仍依赖词汇代理信号,导致“评估幻觉”,即模型优化语言流畅性而非事实临床正确性,引发诊断性关键错误。为弥合这一差距,我们引入了 Clinical Abnormality Benchmarking Substrate(CABS),一个结构化系统,用于将放射学报告分解为可验证的临床语义单元。使用 CABS,我们识别了标准 RL 中的“机制性偏离”,即表面相似性奖励驱动策略梯度绕过医学事实。我们因此提出了 Trajectory-Integral Feedback GRPO(TIF-GRPO),一个将控制理论原理集成到策略优化中的新框架。通过将临床推理建模为异常发现的伪时间轨迹,TIF-GRPO 通过一个积分反馈环路调节解剖结构感知奖励,该环路对持续遗漏进行累积状态误差惩罚,并抑制幻觉作为过度控制作用。实验在 3D CT 基准测试上表明,我们的方法显著增强了异常检测和临床忠诚性,确立了医学 VLM 中进行细粒度调节的新范式。我们的项目已于 https://github.com/ZJU4HealthCare/TIF-GRPO 提供。

关键词

引用

@article{arxiv.2605.20277,
  title  = {Regulating Anatomy-Aware Rewards via Trajectory-Integral Feedback for Volumetric Computed Tomography Analysis},
  author = {Tianwei Lin and Zhongwei Qiu and Jie Cao and Jiang Liu and Wenjie Yan and Bo Zhang and Yu Zhong and Wenqiao Zhang and Yingda Xia and Ling Zhang},
  journal= {arXiv preprint arXiv:2605.20277},
  year   = {2026}
}