中文

IRIS:用于缓解多模态幻觉的隐式奖励引导内部筛选

机器学习 2026-02-04 v2 人工智能

摘要

幻觉仍是多模态大语言模型 (MLLMs) 的根本挑战。虽然直接偏好优化 (DPO) 是关键的对齐框架,但现有方法通常严重依赖于昂贵的外部评估者进行评分或重写,导致政策学习差距和离散损失。由于缺乏对内部状态的访问,这类反馈忽略了在生成过程中不同模态之间细粒度冲突。为此,我们提出 IRIS (Implicit Reward-Guided Internal Sifting),利用连续隐式奖励保留完整信息密度,捕获内部模态竞争。该基于策略的方法通过利用自生成的偏好对消除学习差距。通过基于多模态隐式奖励筛选这些对,IRIS 确保优化由直接解决模态冲突的信号驱动。大量实验表明,仅使用 5.7k 个样本,IRIS 在关键幻觉基准上实现了高度具竞争力的性能,而无需任何外部反馈进行偏好对齐。这些结果确认 IRIS 提供了一种高效且原则的方法,用于缓解 MLLM 幻觉。

关键词

引用

@article{arxiv.2602.01769,
  title  = {IRIS: Implicit Reward-Guided Internal Sifting for Mitigating Multimodal Hallucination},
  author = {Yuanshuai Li and Yuping Yan and Jirui Han and Fei Ming and Lingjuan Lv and Yaochu Jin},
  journal= {arXiv preprint arXiv:2602.01769},
  year   = {2026}
}