你的视频语言模型是可靠的评判者吗?
计算机视觉与模式识别
2025-03-11 v1 人工智能
摘要
随着视频语言模型(VLMs)在各种场景中获得越来越多的应用,对其性能进行鲁棒且可扩展的评估的需求变得日益关键。传统的基于人类专家的 VLMs 评估在一致性和可扩展性方面存在局限,这激发了对自动评估方法(如采用 VLMs 评估 VLMs)的兴趣。然而,VLMs 作为评判者的可靠性仍有待深入探索。现有方法通常依赖单一 VLM 作为评估器。然而,这种方法可能不可靠或存在偏差,因为此类模型可能缺乏完全理解内容的能力且可能具有固有偏差,最终损害评估的可靠性。一种补救措施是应用集体思维原则,聚合多个 VLMs 的评估以增强可靠性。本研究调查了此类方法的有效性,特别是当评判者池中同时包含可靠和不可靠的模型时。我们的发现表明,纳入来自这种混合池的集体判断并不一定能提高最终评估的准确性。纳入可靠性较低的评判者会引入噪声,从而破坏结果的整体可靠性。为了探索影响评估可靠性的因素,我们对一个表现不佳的 VLM 评判者 Video-LLaVA 进行了微调,并观察到仅提高理解能力不足以使 VLM 评判者更可靠。这些发现强调了集体思维方法的局限性,并凸显了对能够考虑单个模型可靠性的更先进方法的需求。我们的研究促进了 VLMs 更可靠评估方法的发展。
引用
@article{arxiv.2503.05977,
title = {Is Your Video Language Model a Reliable Judge?},
author = {Ming Liu and Wensheng Zhang},
journal= {arXiv preprint arXiv:2503.05977},
year = {2025}
}