中文

超越人工数据:利用语言模型扩展问题求解的自训练

机器学习 2024-04-19 v4

摘要

在人工生成的数据上微调语言模型(LM)仍是一种普遍做法。然而,此类模型的性能往往受限于高质量人工数据的数量与多样性。在本文中,我们探讨在能够获得标量反馈的任务上——例如在可以验证正确性的数学问题上——是否可以超越人工数据。为此,我们研究了一种基于期望最大化的简单自训练方法,我们称之为ReSTᴱᴹ,其中我们(1)从模型生成样本并使用二元反馈进行过滤,(2)在这些样本上微调模型,以及(3)重复此过程数次。在使用PaLM-2模型对高级MATH推理和APPS编码基准进行测试时,我们发现ReSTᴱᴹ随模型规模扩展表现良好,并显著超越了仅在人工数据上微调的效果。总体而言,我们的发现表明,带有反馈的自训练可以大幅减少对人工生成数据的依赖。

关键词

引用

@article{arxiv.2312.06585,
  title  = {Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models},
  author = {Avi Singh and John D. Co-Reyes and Rishabh Agarwal and Ankesh Anand and Piyush Patil and Xavier Garcia and Peter J. Liu and James Harrison and Jaehoon Lee and Kelvin Xu and Aaron Parisi and Abhishek Kumar and Alex Alemi and Alex Rizkowsky and Azade Nova and Ben Adlam and Bernd Bohnet and Gamaleldin Elsayed and Hanie Sedghi and Igor Mordatch and Isabelle Simpson and Izzeddin Gur and Jasper Snoek and Jeffrey Pennington and Jiri Hron and Kathleen Kenealy and Kevin Swersky and Kshiteej Mahajan and Laura Culp and Lechao Xiao and Maxwell L. Bileschi and Noah Constant and Roman Novak and Rosanne Liu and Tris Warkentin and Yundi Qian and Yamini Bansal and Ethan Dyer and Behnam Neyshabur and Jascha Sohl-Dickstein and Noah Fiedel},
  journal= {arXiv preprint arXiv:2312.06585},
  year   = {2024}
}

备注

Accepted to TMLR. Camera-ready version. First three authors contributed equally