CricBench:用于评估板球分析中 LLMs 的多语言基准
计算与语言
2026-04-14 v3 人工智能
摘要
板球是全球第二大受欢迎的运动,数十亿球迷寻求通过标准网络搜索无法获得的先进统计洞察。尽管 LLMs 在 Text-to-SQL 任务中取得了显著进展,但它们在体育分析中处理领域特定细节和多语言要求的能力仍有待探索。我们提出了 CricBench,一个基准套件,用于评估 LLMs 在四种赛制的板球数据上固有的 SQL 生成能力:Test、ODI、T20I 和 IPL。我们精心整理了一个包含 2,654 个评估实例的黄金标准数据集,涵盖四种语言(英语、印地语、旁遮普语和泰卢固语)。我们使用仅模式提示评估了七个模型:GPT-5 Mini、Claude Sonnet 4、DeepSeek R1 和 V3、Qwen 235B、Llama 3.1 和 Gemma 2。没有单一模型在所有赛制中均占优势:GPT-5 Mini 在 Test 板球上领先(12.4% DMA),Qwen 235B 在 IPL(28.7%)和 T20I(17.5%)上领先,且所有模型在困难的 ODI 查询上得分均为 0%。所有模型在语法有效性(>98% 执行准确率)和语义正确性(<29% DMA)之间表现出明显的脱节,与 BIRD 相比存在 37-55 个百分点的领域差距。据我们所知,CricBench 是首个用于板球分析的 Text-to-SQL 基准。
引用
@article{arxiv.2512.21877,
title = {CricBench: A Multilingual Benchmark for Evaluating LLMs in Cricket Analytics},
author = {Parth Agarwal and Navya Kommuri and Trizal Garg and Prisha Singhal and Dhruv Shah and Vaibhav Devraj and Yash Sinha and Jagat Sesh Challa and Murari Mandal and Dhruv Kumar},
journal= {arXiv preprint arXiv:2512.21877},
year = {2026}
}
备注
Under Review