中文

LLM 是否具备感知时间能力?一项实证研究

计算与语言 2026-04-02 v1 人工智能

摘要

大型语言模型无法估计其自身任务所需时间。我们通过四项实验(涵盖 68 项任务和四类模型)检讨这一局限。前测估计实际持续时间的 4--7 倍(p<0.001p < 0.001),模型预测的人类规模分钟数与实际秒级完成的任务相差甚远。相对排序也不理想:在设计以揭示启发式依赖的任务对上,模型得分在或低于随机(GPT-5 在反直觉任务对上仅得 18%,p=0.033p = 0.033),在复杂度标签误导时系统性失败。事后回忆与现实脱节——估计值对实际值的偏差可达一个数量级。这些失败在多步骤智能体环境中仍然存在,错误可达 5--10 倍。这些模型虽具备来自训练的时程知识,却缺乏对自身推理时间的经验性 grounding,对智能体调度、规划和时间关键情境具有实际意义。

关键词

引用

@article{arxiv.2604.00010,
  title  = {Can LLMs Perceive Time? An Empirical Investigation},
  author = {Aniketh Garikaparthi},
  journal= {arXiv preprint arXiv:2604.00010},
  year   = {2026}
}

备注

ICLR 2026 I Can't Believe It's Not Better Workshop