中文

HSCR:用于对齐医学视觉语言模型的分层自对比奖励

计算机视觉与模式识别 2025-06-03 v1 计算与语言

摘要

医学视觉语言模型(Med-VLMs)已在各种任务中取得成功,然而现有大多数方法忽视了模态失配问题,该问题可能导致临床环境中的不可信响应。本文提出分层自对比奖励(HSCR),一种解决 Med-VLM 对齐中两个关键挑战的新方法:1)高质量偏好数据的低成本生成;2)捕获细微且上下文感知的偏好以改进对齐。HSCR 首先利用 Med-VLMs 的固有能力,以更高的采样概率生成非偏好响应。通过分析视觉 token 丢弃后的输出 logit 偏移,我们识别出导致失配的模态耦合 token,并推导出隐式对齐奖励函数。该函数在解码期间用幻觉 token 替换原 token,生成高质量的非偏好数据。此外,HSCR 引入了多层级偏好优化策略,通过纳入细微的隐式偏好,超越传统的相邻层级优化,利用非偏好数据中的相对质量捕获细微的对齐线索,以实现更精确且上下文感知的优化。在包括 Med-VQA、医学图像描述和指令跟随在内的多个医学任务上的大量实验表明,HSCR 不仅增强了零样本性能,而且仅用 2,000 条训练数据就显著提升了模态对齐和可信度。

关键词

引用

@article{arxiv.2506.00805,
  title  = {HSCR: Hierarchical Self-Contrastive Rewarding for Aligning Medical Vision Language Models},
  author = {Songtao Jiang and Yan Zhang and Yeying Jin and Zhihang Tang and Yangyang Wu and Yang Feng and Jian Wu and Zuozhu Liu},
  journal= {arXiv preprint arXiv:2506.00805},
  year   = {2025}
}