中文

评估者的评估者:大型视觉语言模型能否公平评估图表理解与推理?

计算与语言 2025-07-08 v2 计算机视觉与模式识别

摘要

图表因其帮助人们理解和推理数据而广为常见。最近涌现出各种下游任务,如图表问答、chart2text 和事实核查。大型视觉语言模型(LVLMs)在应对这些任务方面显示出前景,但其评估成本高昂且耗时,限制了实际应用。虽然将 LVLMs 作为评估其他 LVLMs 图表理解能力的评估者可简化评估流程,但受限于专有数据集、对强大模型的限制访问以及评估成本等挑战,仍难以在工业界广泛采用。为此,我们全面评估了 13 个开源 LVLMs 作为图表理解与推理任务的评估者。我们设计了覆盖事实正确性、信息丰富性和相关性等标准的两两比较和点评任务。此外,我们基于格式遵循性、位置一致性、长度偏好和指令遵循性等方面分析了 LVLMs 评估者。我们专注于成本效益高的开源 LVLMs(参数不足 10B),并遵循标准化的评估协议和评分标准来衡量 LVLMs 评估者的准确性。实验结果显示出显著差异:虽然部分开源 LVLMs 评估者可实现接近 GPT-4 水平的评估性能(约 80% 的一致性),但其他模型则表现不佳(低于约 10% 的一致性)。我们的发现表明,领先的开源 LVLMs 可作为图表相关任务的高性价比自动评估器,尽管仍存在位置偏好和长度偏好等偏差问题。

关键词

引用

@article{arxiv.2505.08468,
  title  = {Judging the Judges: Can Large Vision-Language Models Fairly Evaluate Chart Comprehension and Reasoning?},
  author = {Md Tahmid Rahman Laskar and Mohammed Saidul Islam and Ridwan Mahbub and Ahmed Masry and Mizanur Rahman and Amran Bhuiyan and Mir Tafseer Nayeem and Shafiq Joty and Enamul Hoque and Jimmy Huang},
  journal= {arXiv preprint arXiv:2505.08468},
  year   = {2025}
}

备注

Accepted at ACL 2025 Industry Track