通过去偏自我判断提升 LVLMs 的对齐性
计算机视觉与模式识别
2025-09-12 v2 计算与语言
摘要
大语言模型(LLMs)和大型视觉语言模型(LVLMs)的快速发展为将视觉与语言模态集成开辔了新机遇,但有效对齐这些模态仍具有挑战,常导致幻觉——即生成的输出未植根于视觉输入——并在各类领域引发安全问题。现有的对齐方法,如指令调谐和偏好调谐,往往依赖外部数据集、人工标注或复杂的后处理,限制了可扩展性并增加成本。为此,我们提出一种新方法,生成去偏自我判断得分(debiased self-judgment score),即一种由模型内部自我评估创建的评估指标,无需依赖外部资源。这使模型能够自主提升对齐性。我们的 метод 通过增强解码策略和偏好调谐过程,导致幻觉减少、安全性提升以及整体能力提升。实证结果表明,我们的方法显著优于传统方法,为对齐 LVLMs 提供了更有效的解决方案。
引用
@article{arxiv.2508.20655,
title = {Improving Alignment in LVLMs with Debiased Self-Judgment},
author = {Sihan Yang and Chenhang Cui and Zihao Zhao and Yiyang Zhou and Weilong Yan and Ying Wei and Huaxiu Yao},
journal= {arXiv preprint arXiv:2508.20655},
year = {2025}
}
备注
EMNLP 2025 Findings