PABU:面向高效 LLM 智能体的进度感知信念更新
人工智能
2026-02-11 v1 计算与语言
摘要
大型语言模型 (LLM) 智能体通常基于完整的动作-观察历史进行动作决策,这会引入任务无关信息,容易导致冗余动作和更高的推理成本。我们提出了进度感知信念更新 (Progress-Aware Belief Update, PABU),这是一种信念状态框架,通过显式建模任务进度并有选择地保留过去的动作和观察,紧凑地表示智能体的状态。在每一步,智能体预测自上一轮以来的相对进度,并决定是否存储新遇到的交互情况,以便在未来决策时仅依赖保留下来的子集。在 AgentGym 基准测试中的八个环境中,采用相同训练轨迹,PABU 实现了 81.0% 的任务完成率,超越了使用完整历史信念的前沿 (State of the art, SoTA) 模型 23.9%。此外,PABU 的进度导向动作选择提高了效率,将平均交互步骤数降至 9.5,降低了 26.9%。消融研究表明,显式进度预测和选择性保留对可靠的信念学习和性能提升至关重要。
引用
@article{arxiv.2602.09138,
title = {PABU: Progress-Aware Belief Update for Efficient LLM Agents},
author = {Haitao Jiang and Lin Ge and Hengrui Cai and Rui Song},
journal= {arXiv preprint arXiv:2602.09138},
year = {2026}
}