中文

WebAgents的智能测试时扩展

人工智能 2026-02-13 v1 计算与语言

摘要

测试时扩展已成为提升神经网络模型性能与可靠性的标准方法,但其在智能多步骤任务上的表现尚不明了:小的单步误差会在长时间跨度内叠加;我们发现,单一增加采样的简单策略会产生报酬递减。本文提出CATTS(Confidence-Aware Test-Time Scaling)技术,通过动态分配计算资源来优化多步骤智能体的性能。我们首先对推理时扩展在网页智能体上的行为进行实证研究,发现在长期跨度环境中,单一增加单步计算会迅速饱和。随后我们探索更强的聚合策略,包括基于LLM的仲裁者可超越简单投票,但可能高胜 consensus 决策。我们表明,来自智能体自身投票分布的不确定性统计(熵与top-1/top-2边际)与下游成功率相关,为动态计算分配提供了实用信号。基于这些发现,我们引入基于置信度的测试时扩展(CATTS),利用投票派生的不确定性在决策确实具有争议时仅分配计算资源。CATTS在WebArena-Lite和GoBrowse上相较于React实现了最高9.1%的性能提升,同时使用最高2.3倍更少的 token,实现效率提升并提供可解释的决策规则。

关键词

引用

@article{arxiv.2602.12276,
  title  = {Agentic Test-Time Scaling for WebAgents},
  author = {Nicholas Lee and Lutfi Eren Erdogan and Chris Joseph John and Surya Krishnapillai and Michael W. Mahoney and Kurt Keutzer and Amir Gholami},
  journal= {arXiv preprint arXiv:2602.12276},
  year   = {2026}
}