LLaVA-Critic: 学习评估多模态模型
计算机视觉与模式识别
2025-03-05 v2 计算与语言
摘要
我们引入 LLaVA-Critic,首个面向广泛多模态任务评估的开源大型多模态模型(LMM)。LLaVA-Critic 使用高质量的批评指令数据集进行训练,该数据集包含多样化的评估标准和情景。我们的实验表明,该模型在两个关键领域表现突出:(1)LMM 作为评判员,其中 LLaVA-Critic 提供可靠的评估得分,在多个评估基准中表现与 GPT 模型持平或更优;(2)偏好学习,其中它生成用于偏好学习的奖励信号,增强模型对齐能力。本工作凸显了开源 LMM 在自我批评和评估方面的潜力,为 LMM 可扩展的超人类对齐反馈机制的研究铺平了道路。
引用
@article{arxiv.2410.02712,
title = {LLaVA-Critic: Learning to Evaluate Multimodal Models},
author = {Tianyi Xiong and Xiyao Wang and Dong Guo and Qinghao Ye and Haoqi Fan and Quanquan Gu and Heng Huang and Chunyuan Li},
journal= {arXiv preprint arXiv:2410.02712},
year = {2025}
}
备注
Accepted by CVPR 2025; Project Page: https://llava-vl.github.io/blog/2024-10-03-llava-critic