中文

LLM 预测评分与验证:从非结构化文本推断经验评级

计算与语言 2026-04-17 v1

摘要

我们让 GPT-4.1 阅读 baseball 粉丝关于他们比赛日经历的 written text,并预测每位粉丝在 0-10 调查比例尺上给出的整体经验评级。该模型仅收到单条 open-ended response 的 text。将这些 AI 预测与大约 10,000 条来自五支 Major League Baseball 球队的实际经验评级进行比较。在总体上,约二分之三的预测评级落在自报告粉丝评级 +/-1 之内(67% 落在 +/-1 内,36% 完全匹配),且预测测量在三个独立的评分运行中接近确定性(87% 完全一致,99.9% 落在 +/-1 之内)。预测的评级与 overall experience rating 相关性最强(r = 0.82),而非与任何具体的比赛日经历方面如停车、餐饮、工作人员等。然而,预测值比自报告评级低约一个点,且这一差距并非由任何单一方面驱动。相反,我们的分析表明,自报告评级捕获了粉丝的 verdict,即整体评估判断,这是一种将整个经历整合在内的综合判断。而预测评级则量化了以记忆点、情感强烈、异常或可操作性为特征的 salient 时刻的影响。每一种测量都包含另一种测量遗漏的信息。这些基准结果表明,一个简单且未优化的提示可以在方向性上预测粉丝从粉丝写的 text 中对其经历进行评级,并且该两种数字之间的差距可解释为值得保留的 construct 差异,而非需消除的 error。

关键词

引用

@article{arxiv.2604.14321,
  title  = {LLM Predictive Scoring and Validation: Inferring Experience Ratings from Unstructured Text},
  author = {Jason Potteiger and Andrew Hong and Ito Zapata},
  journal= {arXiv preprint arXiv:2604.14321},
  year   = {2026}
}

备注

29 pages, 5 figures, 6 tables