中文

数学推理类大语言模型是否帮助预测公共交通事件的影响?

人工智能 2025-11-04 v1

摘要

从非结构化文本警报预测公共交通事故持续时间是关键但具有挑战性的任务。由于标准监督微调(SFT)面临数据稀疏问题,难以应用于该任务,因为该任务涉及噪声连续标签,且缺乏可靠的专家演示用于推理。虽然基于可验证奖励的强化学习(RLVR)在具有二进制正确性的任务中表现出色,如数学问题,但其针对噪声连续预测的适用性尚未得到探讨。本文据我们所知是首次将RLVR大语言模型训练与公共交通运营中关键现实 forecasting 挑战建立起来。我们通过引入基于容忍度的塑形奖励函数,在连续误差范围内给予部分信用,而非要求单一正确答案。我们在纽约MTA服务警报的精选数据集上系统性地评估了该框架。我们的发现表明,通用指令微调的大语言模型显著优于专门的数学推理模型,后者在处理模糊现实文本时表现不佳。我们实证证明,二元奖励不稳定且会损害性能,而我们的塑形奖励设计至关重要,使我们的模型在最具挑战性的指标上取得优势。虽然经典回归模型在最小化总体MAE或MSE方面更优,但我们的RLVR方法在5分钟准确率(Acc@5)上相对于最强基线实现了35%的相对改进。这表明RLVR可以成功应用于真实世界、噪声较大的预测场景,但需要奖励验证器的设计能够反映问题的连续性。

关键词

引用

@article{arxiv.2511.00808,
  title  = {Do Math Reasoning LLMs Help Predict the Impact of Public Transit Events?},
  author = {Bowen Fang and Ruijian Zha and Xuan Di},
  journal= {arXiv preprint arXiv:2511.00808},
  year   = {2025}
}