您的LLM代理存在时觉知缺失:工具使用决策与人类时间感知之间的错位
计算与语言
2026-04-17 v3
摘要
大型语言模型(LLM)代理日益增多地用于与动态环境交互并执行任务。然而,这些代理一个关键且被忽视的局限性在于它们默认假设是平稳的上下文,未能考虑消息之间消逝的实际时间。我们称之为"时觉知缺失"。这一局限性阻碍了关于何时调用工具的决策,导致代理要么过度依赖陈旧上下文而跳过必要的工具调用,要么低估上下文而冗余重复调用工具。为研究此挑战,我们构建了TicToc——一个跨越76个情景的、涵盖高、中、低三种时敏度动态环境的多回合用户-代理消息轨迹数据集。我们收集了在每个样本上"调用工具"与"直接作答"的人类偏好,并评估了在不同消逝时间下,LLM工具调用决策与人类偏好之间的对齐程度。我们的分析表明,现有模型在人类时觉知方面的对齐表现不佳,仅有65%的对齐率时,给定时间戳信息后尚无模型实现更好。我们还展示了,针对大多数模型,基于提示的对齐技术效果有限,但特定的后训练对齐是一种可行的解决方案,用于将多回合LLM工具使用与人类时觉知对齐。我们的数据和发现为理解和缓解时觉知缺失提供了第一步,为 fostering开发更时敏感且符合人类预期的代理提供了洞见。
引用
@article{arxiv.2510.23853,
title = {Your LLM Agents are Temporally Blind: The Misalignment Between Tool Use Decisions and Human Time Perception},
author = {Yize Cheng and Arshia Soltani Moakhar and Chenrui Fan and Parsa Hosseini and Kazem Faghih and Zahra Sodagar and Wenxiao Wang and Soheil Feizi},
journal= {arXiv preprint arXiv:2510.23853},
year = {2026}
}
备注
ACL 2026 (findings), Camera-ready