中文

面向语言智能体的情境经验回放

音频与语音处理 2025-06-10 v1

摘要

大型语言模型(LLM)智能体已用于 Web 导航等序列决策任务,但缺乏环境特定经验,往往在这些复杂任务中失败。此外,当前的 LLM 智能体未设计用于在推理期间持续从过往经验中学习,这对于获取这些环境特定经验至关重要。为此,我们提出情境经验回放(Contextual Experience Replay, CER),这是一种无需训练即可为语言智能体在其上下文窗口中实现高效自我提升的框架。具体而言,CER 将过往经验累积并合成为动态记忆缓冲区。这些经验涵盖环境动力学和常见决策模式,使智能体能够在新任务中检索并增强自身,以提升在复杂环境中的适应性。我们在具有挑战性的 WebArena 与 VisualWebArena 基准测试上对 CER 进行评估。在 VisualWebArena 上,CER 实现了 31.9% 的竞争性能。在 WebArena 上,CER 也获得了 36.7% 的平均成功率,显著提升了 GPT-4o 基线智能体的成功率 51.0%。我们还对 CER 进行了全面分析,以证明其效率、有效性并加以理解。

关键词

引用

@article{arxiv.2506.06697,
  title  = {Exploring Length Generalization For Transformer-based Speech Enhancement},
  author = {Qiquan Zhang and Hongxu Zhu and Xinyuan Qian and Eliathamby Ambikairajah and Haizhou Li},
  journal= {arXiv preprint arXiv:2506.06697},
  year   = {2025}
}

备注

14 pages; Accepted by TASLP