中文

用于大规模多模态基准测试的判决模型

机器学习 2026-01-13 v1 人工智能 计算与语言 计算机视觉与模式识别 多智能体系统

摘要

我们提出了一个专门的多模态判决模型,旨在为多样化任务提供可靠且可解释的评估。我们的基准涵盖文本、音频、图像和视频等多种模态,源自精心挑选的公开数据集,并使用固定随机种子以确保可重复性并最小化训练测试泄漏。不同于简单的评分, our 框架聚合多模态判断,分析模型输出的质量和推理一致性,并生成诊断性反馈。我们评估了包括 Gemini 2.5、Phi 4 和 Qwen 2.5 在内的多个多模态大语言模型,在 280 个多模态样本上进行评估,并将判决模型评估与人类标注员的得分进行比较。结果显示,判决模型与人类得分之间存在强大的一致性,表明其作为未来多模态 AI 研究中可扩展、可解释评估管道的潜力巨大。

关键词

引用

@article{arxiv.2601.06106,
  title  = {Judge Model for Large-scale Multimodality Benchmarks},
  author = {Min-Han Shih and Yu-Hsin Wu and Yu-Wei Chen},
  journal= {arXiv preprint arXiv:2601.06106},
  year   = {2026}
}