中文

关于大型语言模型进行序列决策建模能力的研究

偏微分方程分析 2024-10-10 v1

摘要

大型预训练模型在不同模态上的推理和规划任务中表现出越来越好的性能,为在复杂序列决策问题中利用它们打开了可能性。在本文中,我们研究了大型语言模型(LLMs)用于强化学习(RL)的能力。我们评估它们产生决策策策的能力,直接通过生成动作或间接通过首先生成奖励模型来训练智能体。我们的结果表明,即使没有任务特定的微调,LLMs在奖励建模方面表现出色。特别是,通过人工智能(AI)反馈制作奖励是最通用的方法,并且可以通过改善信用分配和探索来提升性能。最后,在动态不熟悉的环境中,我们探索了如何通过合成数据微调LLMs以显著提高其奖励建模能力,同时缓解灾难性遗忘,从而进一步拓宽其在序列决策任务中的实用性。

关键词

引用

@article{arxiv.2410.05657,
  title  = {A pathwise approach to the enhanced dissipation of passive scalars advected by shear flows},
  author = {Victor Gardner and Kyle L. Liss and Jonathan C. Mattingly},
  journal= {arXiv preprint arXiv:2410.05657},
  year   = {2024}
}

备注

42 pages