中文

面向临床意识的医学视觉语言模型多模态偏好优化方法

计算机视觉与模式识别 2025-06-05 v4 人工智能 计算与语言 机器学习

摘要

大型视觉语言模型(LVLMs)的发展推动了其在医学领域的应用。然而,医学 LVLMs(Med-LVLMs)因模态错位导致事实性挑战,其中模型优先于视觉输入而非文本知识,导致与医学图像信息矛盾的幻觉。之前的尝试通过偏好优化来增强 Med-LVLMs 的模态对齐,但在adequately 缓解临床相关性方面不足,使得这些样本容易被辨识,从而降低对齐效果。为解决这一挑战,我们提出了 MMedPO,这是一种考虑临床相关性的医学多模态偏好优化方法,以增强 Med-LVLM 的对齐。MMedPO 通过引入两种不偏好:(1) 通过目标 Med-LVLMs 或 GPT-4o 注入可能的幻觉,以产生医学不准确的响应;(2) 通过局部 lesion-noising 实现病灶区域忽视,破坏关键区域的视觉理解。我们根据来自多个 Med-LLMs 和视觉工具的评分为每个样本计算临床相关性,并将这些分数整合到偏好优化过程中作为权重,从而实现有效的对齐。我们的实验表明,MMedPO 在 Med-LVLMs 的事实准确性方面显著提升,平均在 Med-VQA 和报告生成任务中分别超过现有偏好优化方法 14.2% 和 51.7%。我们的代码已公开 https://github.com/aiming-lab/MMedPO。

关键词

引用

@article{arxiv.2412.06141,
  title  = {MMedPO: Aligning Medical Vision-Language Models with Clinical-Aware Multimodal Preference Optimization},
  author = {Kangyu Zhu and Peng Xia and Yun Li and Hongtu Zhu and Sheng Wang and Huaxiu Yao},
  journal= {arXiv preprint arXiv:2412.06141},
  year   = {2025}
}

备注

ICML 2025