评估多轮语言模型的时间一致性
计算与语言
2026-04-28 v1
摘要
语言模型日益被部署于交互式场景,其中用户需对事实进行时间推理而非孤立处理。在此类场景下,正确行为要求模型在对话早期维持和更新隐式的时间假设。我们通过时间范围稳定性来研究这一挑战:在对话回合之间保持、覆盖写或转移时间范围化事实上下文的能力。我们引入 ChronoScope,一个大规模诊断基准测试,旨在隔离受控多轮交互中的时间范围行为,包含超过一百万个基于 Wikidata 确定性生成的问答链。ChronoScope 评估模型在后续问题省略显式时间参考时,是否正确保留推断的时间范围,涵盖隐式 carryover、显式范围切换、跨实体转移和更长的时间轨迹。通过对最新语言模型的广泛评估,我们发现,在受控的多轮场景中,时间范围稳定性经常被破坏,模型往往趋向当代假设,尽管底层知识正确。随着交互长度增加,这些失败现象加剧,即便在拥有 oracle 上下文条件下也依然存在,揭示了单轮事实准确性与顺序交互下连贯时间推理之间的鸿沟。我们将公开此数据集和评估套件,地址为 https://github.com/yashkumaratri/ChronoScope。
关键词
引用
@article{arxiv.2604.23051,
title = {Evaluating Temporal Consistency in Multi-Turn Language Models},
author = {Yash Kumar Atri and Steven L. Johnson and Tom Hartvigsen},
journal= {arXiv preprint arXiv:2604.23051},
year = {2026}
}
备注
Accepted at ACL 2026