中文

早问、晚问、问对:澄清时机对长周期智能体何时重要?

计算与语言 2026-05-11 v1

摘要

长周期AI智能体执行包含数百个连续动作的复杂工作流,然而,早期的一个错误假设就可能级联成不可逆的错误。当指令不完整时,智能体不仅需要决定是否请求澄清,还要决定何时请求,而此前没有工作衡量过澄清价值在执行过程中如何变化。我们引入了一个强制注入框架,该框架在智能体轨迹的受控点,跨越四个信息维度(目标、输入、约束、上下文)、三个智能体基准和四个前沿模型(每个基准三个模型;一个模型仅在一个基准上;84个任务变体;6000多次运行),提供真实澄清。与“越早越好”的普遍直觉相反,我们发现澄清的价值严重依赖于缺失的信息类型:目标澄清在执行10%后就几乎失去所有价值(pass@3从0.78降至基线),而输入澄清的价值大约能维持到50%。将任何类型的澄清推迟到轨迹中点之后,其性能都会低于从不询问。跨模型的Kendall tau相关系数(在具有相同任务覆盖范围的模型之间为0.78-0.87;在全部4个模型面板上为0.34-0.67)证实了这些时间特征在很大程度上是任务固有的。一项对300次无脚本会话的补充研究表明,当前没有前沿模型会在经验最优窗口内提问,其策略范围从过度提问(52%的会话)到从不提问。这些经验需求曲线为现有理论框架所需但一直缺乏的定量基础提供了支撑,并为具有时间感知的澄清策略建立了具体的设计目标。代码和数据将公开发布。

关键词

引用

@article{arxiv.2605.07937,
  title  = {Ask Early, Ask Late, Ask Right: When Does Clarification Timing Matter for Long-Horizon Agents?},
  author = {Anmol Gulati and Hariom Gupta and Elias Lumer and Sahil Sen and Vamse Kumar Subbiah},
  journal= {arXiv preprint arXiv:2605.07937},
  year   = {2026}
}