认知带宽瓶颈:从基于动作的规划转向基于模式的规划
人工智能
2025-10-09 v1 计算与语言
摘要
使 LLM 能够有效地操作需要长期规划和多次交互的长 horizon 任务,对实现开放世界自主性至关重要。常用方法采用基于动作的规划,即提供可执行的动作列表作为参考。然而,这种动作表示方式在环境动作空间呈指数爆炸时(例如现实世界开放情境)会变得不实用。这自然引出了一个问题:随着环境动作空间的扩大,长期智能体应采用何种最优动作表示方式?本文系统性地研究了两种不同动作表示方式的有效性。第一种是常规的基于动作的规划(PwA),其在现有基准测试中广泛采用。另一种是基于模式的规划(PwS),通过将动作模式实例化为动作列表(例如 "move [OBJ] to [OBJ]" -> "move apple to desk")来确保动作空间简洁且可靠可扩展。后者的 alternative 动机来自其与人类认知的一致性以及其符合环境施加的动作格式限制。我们提出了认知带宽视角作为概念框架,以定性地理解这两种动作表示方式之间的差异,并经验观察到在 ALFWorld(约 35 个动作)和 SciWorld(约 500 个动作)之间存在一种表示选择的临界点,这为表示可扩展性需求提供了证据。我们进一步进行受控实验,研究该临界点位置与不同模型容量之间的相互作用:更强的规划能力会将临界点向右移动,而更好的模式实例化则会将其向左移动。最后,鉴于 PwS 智能体的次优性能,我们提供了构建更具能力的 PwS 智能体以实现更可扩展自主性的可操作指南。
引用
@article{arxiv.2510.07091,
title = {The Cognitive Bandwidth Bottleneck: Shifting Long-Horizon Agent from Planning with Actions to Planning with Schemas},
author = {Baixuan Xu and Tianshi Zheng and Zhaowei Wang and Hong Ting Tsang and Weiqi Wang and Tianqing Fang and Yangqiu Song},
journal= {arXiv preprint arXiv:2510.07091},
year = {2025}
}
备注
22 pages