是时候重新审视精确匹配了
计算与语言
2025-09-23 v1
摘要
时间问答是评估大语言模型时间推理能力的一种既定方法。预期答案通常是数值(例如日期或持续时间),但模型响应却像普通文本一样使用精确匹配(EM)进行评估,无法区分小误差和大误差。在这项调查工作中,我们将时间问答构建为一项数值估计任务,以评估精确匹配的缺点。我们引入了TempAnswerQA,这是一个从Test of Time和TempTabQA提炼出的基准,其中所有问题都需要一个数值型的时间答案,使我们能够超越精确匹配来评估模型。我们使用了预测指标对称平均绝对百分比误差(sMAPE)和平均绝对标度误差(MASE)。通过sMAPE,我们发现误差大小与精确匹配是解耦的。精确匹配得分低的模型,其sMAPE值也低(均约为20%),而有些模型尽管精确匹配得分高,但sMAPE值却很高。与精确匹配相比,使用MASE通过真实数据的偏差来标度误差,会重新排列模型排名,揭示了模型在理解时间领域知识方面的差距,尤其是在使用合成数据训练时。最后,模型最常见的误差是仅偏离真实值。与精确匹配不同,sMAPE和MASE能恰当地衡量这些误差。我们的发现强调了时间问答任务需要专门指标。代码和数据可在https://github.com/aauss/temporal-answer-qa上获取。
引用
@article{arxiv.2509.16720,
title = {Time to Revist Exact Match},
author = {Auss Abbood and Zaiqiao Meng and Nigel Collier},
journal= {arXiv preprint arXiv:2509.16720},
year = {2025}
}
备注
Accepted for Findings of EMNLP 2025