中文

LLM 版 Moneyball:运动叙事中的表格汇总分析

计算与语言 2026-03-24 v2

摘要

大语言模型(LLM)方法的表格汇总依赖大量提示工程、分解管道或面向实体的中间表示才能实现卓越的性能。虽然这些策略有效,但计算成本高昂,且对模型在长篇演绎叙事中保持状态的能力提供了有限的洞察。我们引入 SPORTABSET,一个针对需要跟踪多个实体并在特定规则下聚合统计数据的两个互补运动领域的长上下文表格汇总诊断基准。通过 SporTabSet,我们系统评估了多种基于分解的策略在多个长上下文 LLM 上的表现。结果表明,虽然分解显著提高了准确率和数值保真度,但收益主要来自于解构多实体干扰,而非改进局部算术。鲁棒性实验进一步揭示了对表面层次线索的高度敏感性,包括幻觉、遗漏和角色混淆等结构性失败。综合这些发现,识别出多实体记忆在长上下文表格生成中是关键瓶颈,动机诊断评估是可扩展、高效且可靠表格汇总模型的必要前提。

关键词

引用

@article{arxiv.2510.18173,
  title  = {Moneyball with LLMs: Analyzing Tabular Summarization in Sports Narratives},
  author = {Ritam Upadhyay and Naman Ahuja and Rishabh Baral and Aparna Garimella and Vivek Gupta},
  journal= {arXiv preprint arXiv:2510.18173},
  year   = {2026}
}