中文

OLIVIA:基于推理时动作适应的在线学习框架用于LLM ReAct智能体决策

人工智能 2026-05-13 v1

摘要

大型语言模型智能体在推理、动作选择和观察之间交替进行,以解决序列决策任务。在部署环境中,智能体会反复处理相关的多步骤任务时,小的动作选择错误会累积导致工具调用浪费、延迟增加以及可靠性下降。尽管存在这种部署时的需要改进,现有的LLM智能体推理时适应方法主要依赖提示或检索,这些方法通过上下文操控间接影响行为。对于ReAct风格的智能体,这类方法不暴露用于评分候选动作、代表不确定性或可在动作水平反馈中更新的显式决策层。因此,它们在部署期间提供有限的、细粒度的、不确定性感知的适应支持。我们提出OLIVIA,这是一种针对ReAct风格智能体的推理时动作适应框架。OLIVIA将LLM的最终动作选择层建模为候选动作上的语境线性多臂老板,冻结的隐藏状态作为决策上下文。这种选择特别适用于部署,因为它直接在动作选择接口处调整行为,保留底层推理过程,并提供明确的不确定性估计和来自动作水平反馈的轻量级在线更新。通过upper-confidence-bound探索,OLIVIA以最小的计算开销高效地改进了策略样本。我们在四个基准测试上实现了OLIVIA,表明其在静态ReAct和基于提示的推理时基准方法上始终能显著提升任务性能。我们的结果表明,显式的在线决策层为LLM智能体在部署期间提供了有效的纯提示或检索基于适应方法的替代方案。

关键词

引用

@article{arxiv.2605.11169,
  title  = {OLIVIA: Online Learning via Inference-time Action Adaptation for Decision Making in LLM ReAct Agents},
  author = {Sheldon Yu and Junda Wu and Xintong Li and Nikki Lijing Kuang and Sizhe Zhou and Tong Yu and Jiawei Han and Jingbo Shang and Julian McAuley},
  journal= {arXiv preprint arXiv:2605.11169},
  year   = {2026}
}