衡量评估者:大型视觉语言模型误信息基准测试的质量评估
计算机视觉与模式识别
2026-02-26 v3 人工智能
摘要
尽管在多模态任务中表现卓越,大型视觉语言模型(LVLMs)一直受到误信息(即生成内容与相应视觉输入不一致)的困扰。虽然之前的工作提出了各种基准测试来评估这一问题,但这些评估的质量仍未得到验证。我们注意到,这些基准测试中的一些可能在反复测试中产生不一致的评估结果,或无法与人类评估保持一致。为此,我们提出了误信息基准测试质量测量框架(HQM),该框架利用特定指标来评估可靠性和有效性。我们使用 HQM 进行的经验分析揭示并指出了现有基准测试中潜在的评估问题,暴露了当前误信息评估中的关键差距。为弥合这一差距,我们提出了 HQH(高质量误信息基准测试),该基准测试在 HQM 下在可靠性和有效性方面表现优异,作为可信的评估工具。我们对流行的 LVLMs 在 HQH 上的大规模评估揭示了严重的误信息问题,这些问题不仅发生在模型对问题的主要答案中,也发生在附加分析中。这一发现凸显了未来模型改进以有效缓解误信息并减少其在实际应用中相关安全风险的必要性。我们的基准测试已公开提供,链接为 https://github.com/HQHBench/HQHBench。
引用
@article{arxiv.2406.17115,
title = {Measuring the Measurers: Quality Evaluation of Hallucination Benchmarks for Large Vision-Language Models},
author = {Bei Yan and Jie Zhang and Zheng Yuan and Shiguang Shan and Xilin Chen},
journal= {arXiv preprint arXiv:2406.17115},
year = {2026}
}