通过自我驱动学习提升语言模型的推理能力
计算与语言
2024-05-01 v3 人工智能
摘要
大规模高质量训练数据对于提升模型性能很重要。在使用带有理据(推理步骤)的数据进行训练后,模型获得了推理能力。然而,由于标注成本高,带有高质量理据的数据集相对稀缺。为解决这一问题,我们提出了自我驱动学习框架。该框架促使模型自身在现有数据集上自动生成理据。基于多个理据之间正确性的内在排序,模型学习生成更好的理据,从而带来更高的推理能力。具体而言,我们利用该排序训练一个奖励模型来评估理据的质量,并通过强化学习提升推理性能。Llama2 7B 在多个推理数据集上的实验结果表明,我们的方法显著提升了模型的推理能力,在某些数据集上甚至优于 text-davinci-002。
引用
@article{arxiv.2404.07017,
title = {Improving Language Model Reasoning with Self-motivated Learning},
author = {Yunlong Feng and Yang Xu and Libo Qin and Yasheng Wang and Wanxiang Che},
journal= {arXiv preprint arXiv:2404.07017},
year = {2024}
}
备注
Accepted at LREC-COLING 2024