智能体交互的轨迹采样与分流
人工智能
2026-04-02 v1 计算与语言
摘要
基于大语言模型的智能体应用日益依赖涉及规划、动作执行和环境反馈的多步交互循环。虽然此类系统现已大规模部署,但在部署后改进它们仍然具有挑战性。智能体轨迹数量庞大且非确定性,通过人工审查或辅助LLM逐一审查既缓慢又成本高昂。我们提出了一种轻量级的基于信号的框架,用于对智能体交互轨迹进行分流。我们的方法从实时交互中计算廉价且广泛适用的信号,并将它们作为结构化属性附加到轨迹上,用于轨迹分流,识别可能具有信息价值的交互而不影响在线智能体行为。我们将信号组织为一个粗粒度分类法,涵盖交互(不一致、停滞、脱离、满足)、执行(失败、循环)和环境(耗尽),设计为无需模型调用即可计算。在τ-bench上的受控标注研究中,τ-bench是广泛使用的工具增强型智能体评估基准,我们表明基于信号的采样实现了82%的信息率,而启发式过滤为74%,随机采样为54%,每条信息轨迹的效率提升1.52倍。该优势在奖励层级和任务领域中均稳健,确认信号提供了真实的逐轨迹信息增益,而不仅仅是过度采样明显失败。这些结果表明,轻量级信号可以作为智能体系统的实用采样基础设施,并为偏好数据构建和部署后优化提供路径。
引用
@article{arxiv.2604.00356,
title = {Signals: Trajectory Sampling and Triage for Agentic Interactions},
author = {Shuguang Chen and Adil Hafeez and Salman Paracha},
journal= {arXiv preprint arXiv:2604.00356},
year = {2026}
}