TIDE:基于轨迹的LLM代理测试时改进诊断评估
人工智能
2026-02-04 v2
摘要
最近的进展表明,自主式LLM代理能够通过与环境的迭代交互来提升性能。我们将这一范式定义为测试时改进(TTI)。然而,TTI何时何地成功或失败的机制仍不清晰,现有的评估指标未能捕捉其任务优化效率、错误行为后的行为适应性以及工作记忆对任务完成的具体用处。为此,我们提出了测试时改进诊断评估(TIDE),这是一个无代理、无环境的框架,将TTI分解为三个综合且相互关联的维度。该框架测量(1)任务完成的总体时间动力学,(2)识别性能是否主要受限于递归循环行为,或(3)受累积记忆负担的限制。通过针对各种代理和环境的广泛实验,TIDE表明提升代理性能不仅需要规模化内部推理,更需要显式优化代理与环境之间的交互动力学。
引用
@article{arxiv.2602.02196,
title = {TIDE: Trajectory-based Diagnostic Evaluation of Test-Time Improvement in LLM Agents},
author = {Hang Yan and Xinyu Che and Fangzhi Xu and Qiushi Sun and Zichen Ding and Kanzhi Cheng and Jian Zhang and Tao Qin and Jun Liu and Qika Lin},
journal= {arXiv preprint arXiv:2602.02196},
year = {2026}
}
备注
29pages, 10 figures