中文

输入结构决定性:评估输入结构对 LLM 体育赛后述总结的影响

计算与语言 2025-10-28 v2

摘要

在准确性关键领域(如体育报道)部署大语言模型(LLM)时,一个主要关切是生成的文本是否忠实地反映输入数据。我们量化了输入结构对 LLM 生成体育赛后述总结中幻觉及其他事实错误的影响,涵盖三种格式:行结构化、JSON 和非结构化。我们手动标注了 3,312 条事实错误,涉及 180 场比赛的概述,两个模型分别是 Llama-3.1-70B 和 Qwen2.5-72B。输入结构影响显著:相较于非结构化输入,JSON 输入可使 Llama 错误率降低 69%,Qwen 错误率降低 65%;行结构化输入则使 Llama 错误率降低 54%,Qwen 错误率降低 51%。双因素重复测量方差分析(ANOVA)表明,输入结构解释了方差的 80% 以上,Tukey HSD 事后检验确认所有输入格式之间都存在统计显著差异。

关键词

引用

@article{arxiv.2510.21034,
  title  = {Input Matters: Evaluating Input Structure's Impact on LLM Summaries of Sports Play-by-Play},
  author = {Barkavi Sundararajan and Somayajulu Sripada and Ehud Reiter},
  journal= {arXiv preprint arXiv:2510.21034},
  year   = {2025}
}

备注

Accepted at INLG 2025