中文

迷失在翻译中:LVLM 评判模型能跨语言泛化吗?

计算与语言 2026-04-22 v1

摘要

奖励模型等自动评估器在大型视觉语言模型(LVLMs)的对齐和评估中发挥着核心作用。尽管其重要性日益增加,但这些评估器几乎只在以英语为中心的基准上进行评估,留下了这些评估器跨语言泛化能力如何的开放问题。为回答此问题,我们引入了 MM-JudgeBench,这是首个用于多语言和多模态评判模型评估的大规模基准,包含跨越 25 种类型学上多样化语言的超过 6 万个成对偏好实例。MM-JudgeBench 集成了两个互补子集:扩展 VL-RewardBench 的通用视觉语言偏好评估子集,以及源自 OpenCQA 的以图表为中心的视觉文本推理子集,从而能够对奖励模型(即 LVLM 评判模型)在各种设置下进行系统分析。我们还发布了源自 MM-RewardBench 的多语言训练集,与我们的评估数据不相交,以支持领域适应。通过评估 22 个 LVLM(15 个开源,7 个专有),我们在提出的基准中发现了显著的跨语言性能差异。我们的分析进一步表明,模型大小和架构对多语言鲁棒性的预测能力很弱,即使是最先进的 LVLM 评判模型在不同语言间也表现出不一致的行为。综合而言,这些发现揭示了当前奖励建模的根本局限性,并强调了开发可靠自动评估器需要多语言、多模态基准的必要性。

关键词

引用

@article{arxiv.2604.19405,
  title  = {Lost in Translation: Do LVLM Judges Generalize Across Languages?},
  author = {Md Tahmid Rahman Laskar and Mohammed Saidul Islam and Mir Tafseer Nayeem and Amran Bhuiyan and Mizanur Rahman and Shafiq Joty and Enamul Hoque and Jimmy Huang},
  journal= {arXiv preprint arXiv:2604.19405},
  year   = {2026}
}

备注

Accepted at ACL 2026 Findings