中文

CheXPO-v2:基于知识图谱一致性的胸部 X 光视觉语言模型偏好优化

计算机视觉与模式识别 2025-12-22 v1 机器学习

摘要

医学视觉语言模型 (VLMs) 易产生幻觉,影响临床可靠性。虽然基于稀疏、结果导向奖励的强化学习方法如 Group Relative Policy Optimization (GRPO) 作为低成本对齐方案,但其依赖稀疏结果奖励,导致模型倾向于“过度思考”——生成冗长、晦涩且难以验证的链式思考推理以为答案正当化。这种对结果的关注掩盖事实性错误,构成重大安全风险。为此,我们提出 CheXPO-v2,一种从结果导向转向过程监督的新型对齐框架。我们的核心创新是由实体-关系匹配驱动的知识图谱一致性奖励机制。通过显式解析推理步骤为结构化的"疾病、关系、解剖"三元组,我们提供细粒度监督,对不连贯逻辑和幻觉进行原子级惩罚。结合 hard-example mining 策略,我们的方法在 MIMIC-CXR-VQA 等基准测试上显著优于 GRPO 和最新模型。关键的是,CheXPO-v2 仅使用 5k 样本即可实现新的 SOTA 准确率,显示出卓越的数据效率,同时生成临床上可靠且可验证的推理过程。项目源码公开于:https://github.com/ecoxial2007/CheX-Phi4MM。

关键词

引用

@article{arxiv.2512.17213,
  title  = {CheXPO-v2: Preference Optimization for Chest X-ray VLMs with Knowledge Graph Consistency},
  author = {Xiao Liang and Yuxuan An and Di Wang and Jiawei Hu and Zhicheng Jiao and Bin Jing and Quan Wang},
  journal= {arXiv preprint arXiv:2512.17213},
  year   = {2025}
}