中文

细粒度验证器:视觉语言对齐中的偏好建模与下一词预测

计算机视觉与模式识别 2025-04-22 v4 计算与语言

摘要

近期大型语言模型(LLM)和预训练视觉模型的快速发展推动了视觉语言大模型(VLLM)的发展,增强了视觉与语言模式之间的相互作用。尽管在各个领域取得了显著的成功,但VLLM在模态对齐方面仍面临挑战,这可能导致幻觉和不安全内容生成等问题。当前的对齐技术通常依赖粗糙的反馈和外部数据集,限制了可扩展性和性能。本文提出了FiSAO(Fine-Grained Self-Alignment Optimization),一种新型自我对齐方法,利用模型自身的视觉编码器作为细粒度验证器,以无需额外数据的方式提高视觉语言对齐。通过利用来自视觉编码器的 token 级反馈,FiSAO显著提升了视觉语言对齐,即使超过了需要额外数据的传统偏好调优方法。在理论分析和实验验证中,我们证明FiSAO有效地解决了VLLM中的对齐问题,标志着在此类模型中首次应用了 token 级奖励。

关键词

引用

@article{arxiv.2410.14148,
  title  = {Fine-Grained Verifiers: Preference Modeling as Next-token Prediction in Vision-Language Alignment},
  author = {Chenhang Cui and An Zhang and Yiyang Zhou and Zhaorun Chen and Gelei Deng and Huaxiu Yao and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2410.14148},
  year   = {2025}
}

备注

23 pages; Published as a conference paper at ICLR 2025