CheXPO:面向胸部X光视觉语言模型的偏好优化与反事实理由
计算机视觉与模式识别
2025-07-10 v1 人工智能
摘要
视觉语言模型(VLMs)容易产生幻觉,这在医疗应用中严重削弱了可靠性。虽然偏好优化可以通过临床反馈来缓解这些幻觉,但其实现面临临床无关训练样本、数据分布不平衡以及专家标注成本高昂等挑战。为此,我们提出CheXPO,这是一种胸部X光偏好优化策略,通过置信-相似度联合挖掘和反事实理由实现。我们的方法首先合成了一个统一的、细粒度的多任务胸部X光视觉指令数据集,用于监督式微调(SFT)。随后通过对SFT失败的标记级置信度分析识别困难样本,并使用基于相似性的检索来扩充困难样本以实现偏好样本分布的平衡;同时,合成的反事实理由提供细粒度的临床偏好,无需额外的专家输入。实验表明,CheXPO仅使用5%的SFT样本即可实现8.93%的相对性能提升,跨越各种临床任务达到最先进水平,提供了一个可扩展且可解释的解决方案,适用于实际放射科学应用。
引用
@article{arxiv.2507.06959,
title = {CheXPO: Preference Optimization for Chest X-ray VLMs with Counterfactual Rationale},
author = {Xiao Liang and Jiawei Hu and Di Wang and Zhi Ma and Lin Zhao and Ronghan Li and Bo Wan and Quan Wang},
journal= {arXiv preprint arXiv:2507.06959},
year = {2025}
}