SHAPE:通过迭代生成整体性胜者实现自改进视觉偏好对齐
计算机视觉与模式识别
2025-03-10 v1 人工智能
摘要
大型视觉语言模型(LVLMs)日益依赖偏好对齐以确保可靠性,其通过偏好微调在结构为「图像-胜者文本-败者文本」三元组的偏好数据上引导模型行为。然而,现有方法往往受限于人工标注偏好数据的多样性不足和成本高昂,阻碍了LVLMs充分实现其预期的对齐能力。我们提出了SHAPE,一个自监督框架,能够将已有的丰富监督文本-图像对转化为整体性偏好三元组,以实现更有效、更低成本的对齐,无需人工偏好标注。该方法通过迭代自我改进帮助LVLMs逐步提升对齐能力。其关键设计思路是构建偏好三元组,使胜者文本在整体性上持续提升并在质量上优于败者回答,从而通过偏好微调推动模型「竭尽全力」实现对齐性能。对于每个给定的文本-图像对,SHAPE引入多种视觉增强并与摘要文本配对作为胜者回答,同时将原始文本指定为败者回答。在涵盖多种模型架构和规模的12个基准数据集上的实验,包括LLaVA和DeepSeek-VL,表明SHAPE取得了显著提升,例如在MMVet(综合评估)上提升+11.3%,在MMBench(通用VQA)上提升+1.4%,在POPE(幻觉鲁棒性)上提升+8.0%,均优于7B模型的基线。特别地,定性分析证实了对视觉细节的关注增强以及对整体性描述与人类偏好更好对齐。
引用
@article{arxiv.2503.04858,
title = {SHAPE : Self-Improved Visual Preference Alignment by Iteratively Generating Holistic Winner},
author = {Kejia Chen and Jiawen Zhang and Jiacong Hu and Jiazhen Yang and Jian Lou and Zunlei Feng and Mingli Song},
journal= {arXiv preprint arXiv:2503.04858},
year = {2025}
}