系统化奖励间隙优化以缓解 VLM 幻觉现象
计算与语言
2025-11-25 v4 计算机视觉与模式识别
摘要
直接偏好优化(DPO)在缓解视觉语言模型(VLM)幻觉方面取得了成功,关键依赖于偏好对中的真实奖励间隙。然而,当前方法通常依赖排序或改写策略,难以在数据 curated 过程中系统性地优化这些奖励间隙。核心困难在于精确刻画并战略性地操控整体奖励间隙配置——即在每个偏好对中如何塑造这些奖励间隙的设计。为此,我们引入主题级偏好改写(TPR)框架,以实现奖励间隙配置的系统性优化。通过有选择地替换 VLM 响应中语义主题,以模型自身重新抽样的备选方案进行目标性改写,TPR 能对细粒度语义细节实现主题级控制。这种精确控制使我们能够实施先进的数据 curated 策略,如逐步调整被拒绝响应的难度,从而塑造引导模型克服挑战性幻觉的有效奖励间隙配置。广泛实验表明,TPR 在多个幻觉基准测试中实现了最先进的性能,净增 20%。尤其值得注意的是,TPR 将幻觉减少最高可达 93%(ObjectHal-Bench),并展现出对 VLM 对齐的卓越数据效率,实现稳健且高性价比的对齐。代码与数据集已开放:https://tpr-dpo.github.io。
引用
@article{arxiv.2411.17265,
title = {Systematic Reward Gap Optimization for Mitigating VLM Hallucinations},
author = {Lehan He and Zeren Chen and Zhelun Shi and Tianyu Yu and Jing Shao and Lu Sheng},
journal= {arXiv preprint arXiv:2411.17265},
year = {2025}
}
备注
34 pages, 12 figures, Accepted by NeurIPS 2025