中文

Inclusion Arena: 一个用于通过真实应用评估大型基础模型的开源平台

人工智能 2025-09-03 v2 计算与语言 人机交互

摘要

大语言模型(LLM)和多模态大语言模型(MLLM)已开启人工智能能力的新时代,在多样化场景中展现出接近人类水平的性能。虽然已提出众多基准测试(如MMLU)和排行榜(如Chatbot Arena)来帮助推动LLM和MLLM的发展,但大多数依赖静态数据集或众包通用领域提示,往往难以反映真实应用中的性能。为弥补这一关键差距,我们提出了Inclusion Arena,一个基于AI驱动应用中人类反馈对模型进行排名的实时排行榜。我们的平台将成对模型比较集成到自然用户交互中,确保评估反映实际使用场景。为实现稳健的模型排名,我们采用Bradley-Terry模型并辅以两项关键创新:(1)Placement Matches,一种冷启动机制,用于快速估计新集成模型的初始评分;(2)Proximity Sampling,一种智能比较策略,优先在能力相似的模型之间进行对抗,以最大化信息增益并提升评分稳定性。广泛的实证分析和仿真表明,Inclusion Arena能够产生可靠且稳定的排名,相比通用众包数据集具有更高的数据传递性,并显著降低了恶意操纵的风险。通过促进基础模型与真实应用之间的开放联盟,Inclusion Arena旨在加速真正针对实际、以用户为中心的部署而优化的LLM和MLLM的开发。该平台在https://www.tbox.cn/about/model-ranking公开可访问。

关键词

引用

@article{arxiv.2508.11452,
  title  = {Inclusion Arena: An Open Platform for Evaluating Large Foundation Models with Real-World Apps},
  author = {Kangyu Wang and Hongliang He and Lin Liu and Ruiqi Liang and Zhenzhong Lan and Jianguo Li},
  journal= {arXiv preprint arXiv:2508.11452},
  year   = {2025}
}

备注

Our platform is publicly accessible at https://www.tbox.cn/about/model-ranking