BaziQA-Benchmark:评估大语言模型中的符号与时间组合推理
计算与语言
2026-02-16 v1
摘要
我们提出了BaziQA-Benchmark,一个用于评估大语言模型中符号与时间组合推理的标准化基准。该基准源自全球算命大赛(2021-2025)中200个专业策划的多选题,每个实例需要对一个固定的符号盘和相互作用的时间条件进行结构化推理。与轶事或提示驱动的评估不同,BaziQA-Benchmark能够实现跨年份、领域和模型系列的客观评分和受控比较。我们在多轮设置下评估了当代语言模型,并分析了在时间难度、推理领域和推理协议上的性能变化。为进一步探究推理行为,我们引入了一个轻量级的结构化推理协议,该协议在不增加领域知识的情况下约束推理顺序。结果表明,模型的表现始终优于随机水平,但远未达到饱和,表现出对时间组合和推理顺序的显著敏感性,以及在精确时间定位和多条件符号判断上的系统性失败。
引用
@article{arxiv.2602.12889,
title = {BaziQA-Benchmark: Evaluating Symbolic and Temporally Compositional Reasoning in Large Language Models},
author = {Jiangxi Chen and Qian Liu},
journal= {arXiv preprint arXiv:2602.12889},
year = {2026}
}