中文

多问多得:基于强化学习提示问题的大语言模型决策框架

机器学习 2024-03-01 v2 人工智能 计算与语言

摘要

大语言模型(LLMs)通过将基于动作的策略与思维链(CoT)推理相结合,展现出应对复杂实际挑战的潜力。然而,拥有高质量的提示对该框架的有效性至关重要。目前,这些提示是利用大量人力手工设计的,导致 CoT 策略常常无法泛化。还需要人工干预来开发接地函数,以确保底层控制器恰当地处理 CoT 推理。在本文中,我们提出一个用于复杂任务求解的综合训练框架,将人类先验知识融入动作策略的学习中。为此,我们提出一种新的领导者-跟随者双层框架,能够学习提出相关问题(提示)并随后进行推理以指导动作的学习。提示策略用于基于历史发现进行内省式修正,引导 CoT 过程考虑预期目标并生成导致果断、高性能动作的输出。动作策略随后学习理解和整合 CoT 输出以采取动作。我们的经验数据显示,我们的框架在 Overcooked 和 FourRoom 等 55 个决策任务上优于领先方法。

关键词

引用

@article{arxiv.2310.18127,
  title  = {Ask more, know better: Reinforce-Learned Prompt Questions for Decision Making with Large Language Models},
  author = {Xue Yan and Yan Song and Xinyu Cui and Filippos Christianos and Haifeng Zhang and David Henry Mguni and Jun Wang},
  journal= {arXiv preprint arXiv:2310.18127},
  year   = {2024}
}