中文

基于视觉语言模型的多模态、多任务、多标准自动评估

计算与语言 2026-03-10 v3 人工智能 计算机视觉与模式识别

摘要

视觉语言模型(VLM)在多种多模态任务上展现出惊人的能力。然而,现有的评估 VLMs 生成文本质量的指标通常只针对特定任务(如图像字幕)进行整体评估。虽然整体评估对任何任务都至关重要,但不同任务的优先级标准可能不同,使得当前指标难以适应多任务场景。为此,我们提出了 HarmonicEval,一种参考无关的综合性评估指标,通过聚合各标准得分以自下而上方式产生整体得分。此外,为评估自动评估指标在多任务场景中的通用性,我们构建了 Multi-task Multi-criteria Human Evaluation(MMHE)基准,涵盖 18,000 条来自四个多模态任务的专家人类评判。我们的实验表明,HarmonicEval 在与人类评判相关性方面优于常规指标,同时为每个标准提供数值得分。项目页面:https://stjohn2007.github.io/MMHE_project/。

关键词

引用

@article{arxiv.2412.14613,
  title  = {Multi-modal, Multi-task, Multi-criteria Automatic Evaluation with Vision Language Models},
  author = {Masanari Ohi and Masahiro Kaneko and Naoaki Okazaki and Nakamasa Inoue},
  journal= {arXiv preprint arXiv:2412.14613},
  year   = {2026}
}