VLFeedback:用于大型视觉-语言模型对齐的大规模AI反馈数据集
计算机视觉与模式识别
2024-10-21 v2 计算与语言
摘要
随着大型视觉-语言模型(LVLM)的快速发展,对高质量、多样化数据以对齐这些模型的需求变得日益关键。然而,通过人工监督创建此类数据成本高昂且耗时。本文研究利用 AI 反馈来扩展用于对齐 LVLM 的监督信号的有效性。我们引入了 VLFeedback,这是首个大规模视觉-语言反馈数据集,包含超过 82K 条多模态指令以及由现成模型生成的全面理由,无需人工标注。为评估 AI 反馈在视觉-语言对齐中的有效性,我们训练了 Silkie,这是一个通过直接偏好优化在 VLFeedback 上微调的 LVLM。Silkie 在有用性、视觉忠实度和安全性指标上展现出卓越性能。它在感知和认知任务上分别比其基础模型提升了 6.9% 和 9.5%,减少了 MMHal-Bench 上的幻觉问题,并展现出对红队攻击更强的鲁棒性。此外,我们的分析强调了 AI 反馈的优势,特别是在促进偏好多样性以带来更全面的改进方面。我们的数据集、训练代码和模型可在 https://vlf-silkie.github.io 获取。
引用
@article{arxiv.2410.09421,
title = {VLFeedback: A Large-Scale AI Feedback Dataset for Large Vision-Language Models Alignment},
author = {Lei Li and Zhihui Xie and Mukai Li and Shunian Chen and Peiyi Wang and Liang Chen and Yazheng Yang and Benyou Wang and Lingpeng Kong and Qi Liu},
journal= {arXiv preprint arXiv:2410.09421},
year = {2024}
}
备注
EMNLP 2024 Main Conference camera-ready version (fixed small typos). This article supersedes arXiv:2312.10665