中文

通过去偏自我判断提升 LVLMs 的对齐性

计算机视觉与模式识别 2025-09-12 v2 计算与语言

摘要

大语言模型(LLMs)和大型视觉语言模型(LVLMs)的快速发展为将视觉与语言模态集成开辔了新机遇,但有效对齐这些模态仍具有挑战,常导致幻觉——即生成的输出未植根于视觉输入——并在各类领域引发安全问题。现有的对齐方法,如指令调谐和偏好调谐,往往依赖外部数据集、人工标注或复杂的后处理,限制了可扩展性并增加成本。为此,我们提出一种新方法,生成去偏自我判断得分(debiased self-judgment score),即一种由模型内部自我评估创建的评估指标,无需依赖外部资源。这使模型能够自主提升对齐性。我们的 метод 通过增强解码策略和偏好调谐过程,导致幻觉减少、安全性提升以及整体能力提升。实证结果表明,我们的方法显著优于传统方法,为对齐 LVLMs 提供了更有效的解决方案。

关键词

引用

@article{arxiv.2508.20655,
  title  = {Improving Alignment in LVLMs with Debiased Self-Judgment},
  author = {Sihan Yang and Chenhang Cui and Zihao Zhao and Yiyang Zhou and Weilong Yan and Ying Wei and Huaxiu Yao},
  journal= {arXiv preprint arXiv:2508.20655},
  year   = {2025}
}

备注

EMNLP 2025 Findings