中文

Agent-BRACE:通过语言化状态不确定性解耦长程任务中的信念与行动

计算与语言 2026-05-13 v1 人工智能

摘要

大型语言模型(LLM)越来越多地被部署到部分可观测环境中的长程任务上,在这些任务中,它们必须在许多步骤中推断和跟踪复杂的环境状态的同时采取行动。这带来了两个挑战:部分可观测性要求对未观测到的世界属性保持不确定性,而长交互历史导致上下文无限制地增长,稀释了与任务相关的信息。解决这两个挑战的一个原则性方案是信念状态:给定过去观测和动作的环境状态后验分布,它紧凑地编码了历史信息,用于决策,而与回合长度无关。然而,在LLM智能体中,文本的开放性使得如何表示这种分布变得不明确。因此,我们引入了Agent-BRACE:通过抽象和置信度估计的智能体信念状态表示,这是一种将LLM智能体解耦为信念状态模型和策略模型的方法,并通过强化学习进行联合优化。信念状态模型产生信念分布的结构化近似:一组关于环境的原子自然语言声明,每个声明都带有一个从确定到未知的有序语言化确定性标签。策略模型以这种紧凑的、结构化的近似信念为条件,而不是完整的历史,学习在显式不确定性下选择动作。在长程、部分可观测的具身语言环境中,Agent-BRACE实现了平均绝对性能提升+14.5%(Qwen2.5-3B-Instruct)和+5.3%(Qwen3-4B-Instruct),优于强大的强化学习基线,同时保持了一个近乎恒定的上下文窗口,与回合长度无关。进一步的分析表明,随着证据的积累,学习到的信念在一个回合的过程中变得越来越校准。

关键词

引用

@article{arxiv.2605.11436,
  title  = {Agent-BRACE: Decoupling Beliefs from Actions in Long-Horizon Tasks via Verbalized State Uncertainty},
  author = {Joykirat Singh and Zaid Khan and Archiki Prasad and Justin Chih-Yao Chen and Akshay Nambi and Hyunji Lee and Elias Stengel-Eskin and Mohit Bansal},
  journal= {arXiv preprint arXiv:2605.11436},
  year   = {2026}
}

备注

Code: https://github.com/joykirat18/Agent-BRACE