中文

扩充 LLM 的行动空间以超越语言推理

机器学习 2025-10-20 v2

摘要

大型语言模型 (LLM) 虽然是自然语言中的强大推理器,但其行动通常局限于输出词汇标记。因此,与外部环境(如符号运算符或模拟器)的交互必须通过预定义格式的文本表达、解析后路由至外部接口。这使得模型的语言负担起到了推理与控制双重职责,还需要外部模型之外的 hand-crafted 解析器。为此,我们通过在词汇表之外内化环境交互于扩充行动空间 (ExpA),将环境交互从语言中解耦。模型开始在默认语言环境中推理,但可随时触发路由动作并切换至外部环境。在此期间,模型只能调用环境特定的动作、接收环境反馈,或因结果而将控制权路由回语言。为促进对扩充行动空间及新环境的有效探索,我们引入 ExpA 强化学习 (EARL),采用反事实策略优化。在需要多轮交互和条件规划的任务上,EARL 在词汇受限动作的强基准上取得优势。其在基于计算器的多任务学习中表现稳健,部分观察排序问题中实现完美的 Sort-4 正确率,同时自主发现与经典设计相竞争的高效算法。

关键词

引用

@article{arxiv.2510.07581,
  title  = {Expanding the Action Space of LLMs to Reason Beyond Language},
  author = {Zhongqi Yue and Weishi Wang and Yundaichuan Zhan and Juncheng Li and Daniel Dahlmeier and Fredrik D. Johansson},
  journal= {arXiv preprint arXiv:2510.07581},
  year   = {2025}
}