Silkie:面向大型视觉语言模型的偏好蒸馏
计算机视觉与模式识别
2023-12-19 v1 计算与语言
摘要
本文探索了大型视觉语言模型(LVLMs)的偏好蒸馏,以提升其生成有用且忠实于视觉上下文的响应的能力。我们首先利用 AI 标注构建了一个视觉-语言反馈(VLFeedback)数据集。具体而言,响应由从 12 个 LVLMs 中采样得到的模型生成,条件为来自各种数据集的多模态指令。我们采用 GPT-4V 从有用性、视觉忠实度以及伦理考量方面评估生成的输出。此外,通过直接偏好优化(DPO)方法,偏好监督被蒸馏到 Qwen-VL-Chat 中。由此产生的模型 Silkie 在 MME 基准上的感知和认知能力分别取得了 6.9% 和 9.5% 的相对提升。Silkie 还在 MMHal-Bench 基准上创下了 3.02 的新 SOTA 分数,展现出降低的幻觉现象。进一步分析表明,将 DPO 与我们的 VLFeedback 数据集结合主要提升了 LVLMs 的细粒度感知与复杂认知能力,从而带来比人工标注偏好数据集更全面的提升。
引用
@article{arxiv.2312.10665,
title = {Silkie: Preference Distillation for Large Visual Language Models},
author = {Lei Li and Zhihui Xie and Mukai Li and Shunian Chen and Peiyi Wang and Liang Chen and Yazheng Yang and Benyou Wang and Lingpeng Kong},
journal= {arXiv preprint arXiv:2312.10665},
year = {2023}
}
备注
Project page: https://vlf-silkie.github.io