关于语言模型微调对基于文本的强化学习的影响
计算与语言
2024-04-17 v1
摘要
基于文本的强化学习涉及智能体使用观察到的文本和自然语言中允许的动作与虚构环境交互以完成任务。先前的工作表明,即使在完全缺乏语义理解或其他语言能力的情况下,智能体也能在基于文本的交互环境中成功。这些智能体在玩此类游戏中的成功表明语义理解可能对任务并不重要。这引发了一个关于语言模型在引导智能体通过游戏状态时益处的重要问题。在这项工作中,我们表明丰富的语义理解导致了基于文本的强化学习智能体的高效训练。此外,我们描述了在基于文本的强化学习(TBRL)中,语言模型不恰当的微调会导致语义退化。具体来说,我们描述了语言模型中词语语义表征的偏移,以及它如何影响智能体在与训练游戏语义相似的任务中的表现。我们相信这些结果可能有助于开发更好的策略来微调基于文本的强化学习场景中的智能体。
引用
@article{arxiv.2404.10174,
title = {On the Effects of Fine-tuning Language Models for Text-Based Reinforcement Learning},
author = {Mauricio Gruppi and Soham Dan and Keerthiram Murugesan and Subhajit Chaudhury},
journal= {arXiv preprint arXiv:2404.10174},
year = {2024}
}