中文

多负样本多模态直接偏好优化中的重要性采样

计算机视觉与模式识别 2025-10-01 v1 计算与语言 机器学习

摘要

直接偏好优化(Direct Preference Optimization, DPO)最近扩展到视觉语言模型。然而,现有方法依赖简化的两两比较,通过基本扰动或基于相似性的检索生成单个负样本,无法捕捉多模态偏好复杂性,导致优化偏差和幻觉。为此,我们提出MISP-DPO,即首个将多个语义上多样化负样本纳入多模态DPO框架的方法,基于Plackett-Luce模型。我们将提示和候选图像嵌入到CLIP(Contrastive Language-Image Pretraining)空间,并应用稀疏自编码器以提取语义偏差到可解释因子。根据重建难度、与正样本的语义偏差以及相互多样性选择负样本,获得更广泛且更具信息量的监督。为处理多负样本比较,我们采用Plackett-Luce目标,并引入重要性采样策略以提升训练效率。在五个多样化基准测试上实验表明,MISP-DPO在所有方法上均实现了多模态对齐的持续性提升,验证了在偏好学习中实现语义感知、多负样本采样的有效性。

关键词

引用

@article{arxiv.2509.25717,
  title  = {Importance Sampling for Multi-Negative Multimodal Direct Preference Optimization},
  author = {Xintong Li and Chuhan Wang and Junda Wu and Rohan Surana and Tong Yu and Julian McAuley and Jingbo Shang},
  journal= {arXiv preprint arXiv:2509.25717},
  year   = {2025}
}

备注

Preprint