Playpen:通过对话交互探索学习的环境
计算与语言
2025-09-25 v3
摘要
学习者和反馈提供者之间的交互最近成为大语言模型后训练的焦点,通过使用奖励模型来判断模型响应的适当性。在本文中,我们研究了对话游戏——主要由言语行为驱动的目标导向和规则控制的活动——是否也可以作为学习的反馈信号来源。我们介绍了Playpen,一个通过对话游戏自博弈进行离线和在线学习的环境,并研究了一组具有代表性的后训练方法:监督微调;直接对齐(DPO);以及使用GRPO的强化学习。我们实验了对一个小型LLM(Llama-3.1-8B-Instruct)进行后训练,评估了在未见过的训练游戏实例以及未见过游戏上的性能,以及在标准基准上的性能。我们发现,通过SFT进行模仿学习提高了未见实例上的性能,但负面影响了其他技能,而使用GRPO的交互式学习则显示出平衡的改进,没有技能损失。我们发布了框架和基线训练设置,以促进在(合成)交互中学习这一有前景的新方向的研究。
引用
@article{arxiv.2504.08590,
title = {Playpen: An Environment for Exploring Learning Through Conversational Interaction},
author = {Nicola Horst and Davide Mazzaccara and Antonia Schmidt and Michael Sullivan and Filippo Momentè and Luca Franceschetti and Philipp Sadler and Sherzod Hakimov and Alberto Testoni and Raffaella Bernardi and Raquel Fernández and Alexander Koller and Oliver Lemon and David Schlangen and Mario Giulianelli and Alessandro Suglia},
journal= {arXiv preprint arXiv:2504.08590},
year = {2025}
}
备注
Accepted at EMNLP 2025 (Main) Source code: https://github.com/lm-playpen/playpen Please send correspodence to: [email protected]