中文

面向医疗大型视觉语言模型的直接偏好优化基准测试

计算机视觉与模式识别 2026-01-27 v1 计算与语言

摘要

大型视觉语言模型(LVLM)在医疗应用方面具有巨大潜力,但其部署往往受到对齐不足和可靠性不足的限制。尽管直接偏好优化(DPO)已成为一种用于优化模型响应的强大框架,但其在高风险医疗环境中的有效性仍有待探索,缺乏指导未来方法论进步所需的严格实证基础。为了弥补这一差距,我们首次对医疗领域内的多种 DPO 变体进行了全面考察,在两个医疗 LVLM 上评估了九种不同的公式化方法:LLaVA-Med 和 HuatuoGPT-Vision。我们的结果揭示了几个关键局限性:当前的 DPO 方法相较于监督微调通常产生不一致的增益,且其有效性在不同任务和骨干网络中差异显著。此外,它们经常无法解决根本的视觉误解错误。基于这些见解,我们提出了一种有针对性的偏好构建策略作为概念验证,该策略明确解决了现有 DPO 模型中经常观察到的视觉误解错误。该设计在视觉问答任务中比现有最强的 DPO 基线提高了 3.6%。为了支持未来的研究,我们发布了完整的框架,包括所有训练数据、模型检查点和代码库,网址为 https://github.com/dmis-lab/med-vlm-dpo。

关键词

引用

@article{arxiv.2601.17918,
  title  = {Benchmarking Direct Preference Optimization for Medical Large Vision-Language Models},
  author = {Dain Kim and Jiwoo Lee and Jaehoon Yun and Yong Hoe Koo and Qingyu Chen and Hyunjae Kim and Jaewoo Kang},
  journal= {arXiv preprint arXiv:2601.17918},
  year   = {2026}
}

备注

EACL 2026 (Findings)