中文

DateLogicQA:大型语言模型中时间偏差的基准测试

计算与语言 2025-05-20 v2 人工智能

摘要

本文介绍了 DateLogicQA,这是一个包含 190 个问题的基准测试,涵盖了多种日期格式、时间上下文和推理类型。我们提出了语义完整性指标来评估分词质量,并分析了两种偏差:影响嵌入的表征级偏差和影响推理输出的逻辑级偏差。我们的发现对 LLM 在时间推理方面的能力和局限性提供了全面评估,突显了准确处理时间数据的关键挑战。

关键词

引用

@article{arxiv.2412.13377,
  title  = {DateLogicQA: Benchmarking Temporal Biases in Large Language Models},
  author = {Gagan Bhatia and MingZe Tang and Cristina Mahanta and Madiha Kazi},
  journal= {arXiv preprint arXiv:2412.13377},
  year   = {2025}
}