循环中的语言模型:文本游戏中学习推荐动作的数据最优方法
计算与语言
2023-11-15 v1 人工智能
机器学习
摘要
大语言模型(LLMs)已在语言理解基准中展现出优越性能。CALM 是一种流行方法,利用 LLM——GPT-2——的语言先验为 Jericho 中文本游戏的候选动作推荐提供支撑,而无需环境提供动作。然而,CALM 使用标注的人类游戏玩法调整 GPT-2,并在基于文本游戏的学习过程中保持 LLM 固定。在本工作中,我们探索并评估了在基于文本游戏的学习过程中也更新用于候选推荐的 LLM,以减轻对成本高昂的人类标注游戏玩法的依赖。我们观察到,通过使用精心选择的游戏内转移在学习过程中更新 LLM,可减少微调 LLM 对人类标注游戏玩法的依赖。我们进行了进一步分析以研究更新后 LLM 的可迁移性,并观察到将游戏内训练的模型迁移到其他游戏并未产生一致的迁移效果。
引用
@article{arxiv.2311.07687,
title = {Language Model-In-The-Loop: Data Optimal Approach to Learn-To-Recommend Actions in Text Games},
author = {Arjun Vaithilingam Sudhakar and Prasanna Parthasarathi and Janarthanan Rajendran and Sarath Chandar},
journal= {arXiv preprint arXiv:2311.07687},
year = {2023}
}