中文

KellyBench:一个面向长周期序列决策的基准测试

人工智能 2026-05-01 v1

摘要

语言模型在目标狭窄的程序性任务基准测试中正趋于饱和。但它们正越来越多地被部署在目标开放的长周期、非平稳环境中。本文介绍了 KellyBench,一个用于评估体育博彩市场中序列决策的环境。智能体被置于 2023-24 赛季英格兰足球超级联赛的序列模拟中,其任务是最大化其长期资金增长。它们会获得详细的历史数据,包括高级统计数据、阵容和公开赔率。为了成功,它们必须构建机器学习模型,识别公开市场中的优势,并随着环境随时间变化而适应。我们发现,所有评估的前沿模型在五个随机种子的赛季平均结果上均亏损。表现最好的模型平均回报率为 -8%,许多模型在不同种子下经历了破产。为了评判策略的复杂程度,我们使用人类专家评分标准对每个模型进行评级,发现它们的方法与人类基线相比不够复杂;Claude Opus 4.6 的评分标准得分为 26.5%,这意味着存在显著的改进空间。KellyBench 可通过开放访问的 API 端点获取,地址为 https://openreward.ai/GeneralReasoning/KellyBench。

关键词

引用

@article{arxiv.2604.27865,
  title  = {KellyBench: A Benchmark for Long-Horizon Sequential Decision Making},
  author = {Thomas Grady and Kip Parker and Iliyan Zarov and Henry Course and Chengxi Taylor and Ross Taylor},
  journal= {arXiv preprint arXiv:2604.27865},
  year   = {2026}
}