BabyStories:强化学习能否教会婴儿语言模型写出更好的故事?
计算与语言
2023-10-26 v1
摘要
语言模型的语料库规模显著增长,带来了明显的性能提升。然而,在处理更小、更类人的数据集的模型开发方面进展有限。作为 BabyLM 共享任务的一部分,本研究探讨了基于人类反馈的强化学习(RLHF)对使用有限训练语料从头预训练的语言模型的影响。对比两个 GPT-2 变体,较大的模型在 RLHF 微调后于故事生成任务中表现更优。这些发现表明,由于其更高的学习与适应能力,RLHF 技术可能对较大模型更为有利,尽管还需更多实验来确认该发现。这些见解凸显了在有限数据下对语言模型进行 RLHF 微调的潜在益处,可增强其保持叙事焦点与连贯性的能力,同时在故事生成任务中更好地遵循初始指令。本工作的代码公开于 https://github.com/Zephyr1022/BabyStories-UTSA。
引用
@article{arxiv.2310.16681,
title = {BabyStories: Can Reinforcement Learning Teach Baby Language Models to Write Better Stories?},
author = {Xingmeng Zhao and Tongnian Wang and Sheri Osborn and Anthony Rios},
journal= {arXiv preprint arXiv:2310.16681},
year = {2023}
}
备注
Accepted to BabyLM workshop at CoNLL