中文

KORGym:用于大型语言模型推理评估的动态博弈平台

计算与语言 2025-05-22 v2 人工智能 机器学习

摘要

大型语言模型的最新进展凸显了对更全面评估方法的需求,以准确评估其推理能力。现有的基准测试通常特定于某一领域,因此无法完全捕捉大型语言模型的通用推理潜力。为了解决这一局限性,我们引入了知识正交推理健身房,这是一个受KOR-Bench和Gymnasium启发的动态评估平台。KORGym提供超过五十种文本或视觉格式的博弈,并支持带有强化学习场景的交互式多轮评估。使用KORGym,我们对19个大型语言模型和8个视觉语言模型进行了广泛实验,揭示了模型家族内一致的推理模式,并展示了闭源模型的优越性能。进一步的分析考察了模态、推理策略、强化学习技术和响应长度对模型性能的影响。我们期望KORGym成为推进大型语言模型推理研究以及开发适用于复杂交互环境评估方法的宝贵资源。

关键词

引用

@article{arxiv.2505.14552,
  title  = {KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation},
  author = {Jiajun Shi and Jian Yang and Jiaheng Liu and Xingyuan Bu and Jiangjie Chen and Junting Zhou and Kaijing Ma and Zhoufutu Wen and Bingli Wang and Yancheng He and Liang Song and Hualei Zhu and Shilong Li and Xingjian Wang and Wei Zhang and Ruibin Yuan and Yifan Yao and Wenjun Yang and Yunli Wang and Siyuan Fang and Siyu Yuan and Qianyu He and Xiangru Tang and Yingshui Tan and Wangchunshu Zhou and Zhaoxiang Zhang and Zhoujun Li and Wenhao Huang and Ge Zhang},
  journal= {arXiv preprint arXiv:2505.14552},
  year   = {2025}
}

备注

22 pages