中文

从多 AI 反馈构建视频-文本数据集:促进视频大语言模型的弱到强偏好学习

机器学习 2024-11-26 v1 计算与语言 计算机视觉与模式识别

摘要

高质量的视频-文本偏好数据对于多模态大语言模型(MLLMs)的对齐至关重要。然而,现有的偏好数据非常稀缺。获取用于偏好训练的 VQA 偏好数据成本高昂,并且手动标注响应非常不可靠,这可能导致低质量的数据对。同时,通过温度调整控制的 AI 生成响应缺乏多样性。为了解决这些问题,我们提出了一个高质量的 VQA 偏好数据集,称为 \textit{\textbf{M}ultiple \textbf{M}ultimodal \textbf{A}rtificial \textbf{I}ntelligence \textbf{P}reference Datasets in \textbf{V}QA} (\textbf{MMAIP-V}),它是通过从响应分布集中采样并使用外部评分函数进行响应评估来构建的。此外,为了充分利用 MMAIP-V 中的偏好知识并确保充分优化,我们提出了 \textit{\textbf{Iter}ative \textbf{W}eak-to-\textbf{S}trong \textbf{R}einforcement \textbf{L}earning from \textbf{AI} \textbf{F}eedback for video MLLMs} (\textbf{Iter-W2S-RLAIF}),这是一个通过迭代更新参考模型和执行参数外推来逐步增强 MLLMs 对齐能力的框架。最后,我们在 VQA 评估中提出了一种无偏且信息完整的评估方案。实验表明,MMAIP-V 有利于 MLLMs 的偏好学习,并且 Iter-W2S-RLAIF 充分利用了 MMAIP-V 中的对齐信息。我们相信,所提出的基于 AI 反馈的自动 VQA 偏好数据生成流程可以极大地促进未来 MLLMs 对齐的工作。\textbf{代码和数据集可用} \href{https://anonymous.4open.science/r/MMAIP-V_Iter-W2S-RLAIF-702F}{MMAIP-V\_Iter-W2S-RLAIF-702F}。

关键词

引用

@article{arxiv.2411.16201,
  title  = {Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models},
  author = {Hao Yi and Qingyang Li and Yulan Hu and Fuzheng Zhang and Di Zhang and Yong Liu},
  journal= {arXiv preprint arXiv:2411.16201},
  year   = {2024}
}