中文

ARTIS:基于迭代仿真的代理风险感知测试时扩展

计算与语言 2026-02-04 v2

摘要

当前测试时扩展(TTS)技术通过在推理时分配额外计算资源来提升大语言模型(LLM)性能,但在代理环境中仍不够有效,其中动作会直接与外部环境交互,其影响可能是不可逆且成本高昂的。我们提出了 ARTIS,即基于迭代仿真的代理风险感知测试时扩展框架,通过在真实世界执行前的仿真交互实现探索与承诺的解耦。该设计允许在不增加环境风险的前提下,将推理时计算资源延伸到行动层面,以提高行动可靠性和鲁棒性。我们进一步表明,单纯基于 LLM 的仿真器难以捕捉稀有但高影响力的失效模式,严重限制了其在代理决策中的有效性。为此,我们引入了风险感知工具仿真器,强调在高风险动作上的保真度,通过定向数据生成和再平衡训练实现。多轮和多步骤代理基准测试的实验表明,迭代仿真显著提升了代理的可靠性,而风险感知仿真对在不同模型和任务上持续实现这些收益至关重要。

关键词

引用

@article{arxiv.2602.01709,
  title  = {ARTIS: Agentic Risk-Aware Test-Time Scaling via Iterative Simulation},
  author = {Xingshan Zeng and Lingzhi Wang and Weiwen Liu and Liangyou Li and Yasheng Wang and Lifeng Shang and Xin Jiang and Qun Liu},
  journal= {arXiv preprint arXiv:2602.01709},
  year   = {2026}
}