中文

你的视频语言模型是可靠的评判者吗?

计算机视觉与模式识别 2025-03-11 v1 人工智能

摘要

随着视频语言模型(VLMs)在各种场景中获得越来越多的应用,对其性能进行鲁棒且可扩展的评估的需求变得日益关键。传统的基于人类专家的 VLMs 评估在一致性和可扩展性方面存在局限,这激发了对自动评估方法(如采用 VLMs 评估 VLMs)的兴趣。然而,VLMs 作为评判者的可靠性仍有待深入探索。现有方法通常依赖单一 VLM 作为评估器。然而,这种方法可能不可靠或存在偏差,因为此类模型可能缺乏完全理解内容的能力且可能具有固有偏差,最终损害评估的可靠性。一种补救措施是应用集体思维原则,聚合多个 VLMs 的评估以增强可靠性。本研究调查了此类方法的有效性,特别是当评判者池中同时包含可靠和不可靠的模型时。我们的发现表明,纳入来自这种混合池的集体判断并不一定能提高最终评估的准确性。纳入可靠性较低的评判者会引入噪声,从而破坏结果的整体可靠性。为了探索影响评估可靠性的因素,我们对一个表现不佳的 VLM 评判者 Video-LLaVA 进行了微调,并观察到仅提高理解能力不足以使 VLM 评判者更可靠。这些发现强调了集体思维方法的局限性,并凸显了对能够考虑单个模型可靠性的更先进方法的需求。我们的研究促进了 VLMs 更可靠评估方法的发展。

关键词

引用

@article{arxiv.2503.05977,
  title  = {Is Your Video Language Model a Reliable Judge?},
  author = {Ming Liu and Wensheng Zhang},
  journal= {arXiv preprint arXiv:2503.05977},
  year   = {2025}
}