中文

Reflecting with Two Voices: A Co-Adaptive Dual-Strategy Framework for LLM-Based Agent Decision Making

人工智能 2026-02-03 v2

摘要

大型语言模型(LLM)智能体常依赖外部演示或检索增强规划,导致脆弱性、泛化性差及高计算开销。灵感来自人类问题解决方式,我们提出 DuSAR(Dual-Strategy Agent with Reflecting),即演示-free 框架,使单个冻结 LLM 能通过两种互补策略实现共适应推理:一种是高层次整体计划,另一种是基于上下文的局部策略。这两种策略通过轻量级反思机制相互交互,智能体持续评估进展情况(通过策略适配度评分),在遇到瓶颈时动态修订全局计划,或在取得实质性进展时细化计划,模拟人类的元认知行为。在模拟家庭环境(ALFWorld)和真实网页环境(Mind2Web)中,DuSAR 实现了仅使用开源 LLM 即达到最先进性能,显著优于所有先前方法,无需任何演示或微调。值得注意的是,它在保持强任务成功率的同时大幅降低了每步 token 消耗。消融研究确认双策略协调的必要性。此外,灵活地集成专家演示还能进一步提升性能,凸显 DuSAR 的灵活性与与外部知识的兼容性。

关键词

引用

@article{arxiv.2512.08366,
  title  = {Reflecting with Two Voices: A Co-Adaptive Dual-Strategy Framework for LLM-Based Agent Decision Making},
  author = {Wentao Zhang and Qunbo Wang and BoXuan Zhao and Tao Zhang and Junsheng Wu and Hongping Gan and Ling Dai and Shizhuang Deng and Shuntong Sun and Yang Liu},
  journal= {arXiv preprint arXiv:2512.08366},
  year   = {2026}
}