DateLogicQA:大型语言模型中时间偏差的基准测试
计算与语言
2025-05-20 v2 人工智能
摘要
本文介绍了 DateLogicQA,这是一个包含 190 个问题的基准测试,涵盖了多种日期格式、时间上下文和推理类型。我们提出了语义完整性指标来评估分词质量,并分析了两种偏差:影响嵌入的表征级偏差和影响推理输出的逻辑级偏差。我们的发现对 LLM 在时间推理方面的能力和局限性提供了全面评估,突显了准确处理时间数据的关键挑战。
引用
@article{arxiv.2412.13377,
title = {DateLogicQA: Benchmarking Temporal Biases in Large Language Models},
author = {Gagan Bhatia and MingZe Tang and Cristina Mahanta and Madiha Kazi},
journal= {arXiv preprint arXiv:2412.13377},
year = {2025}
}