通过交互式示范教语言模型自我改进
计算与语言
2024-04-02 v2
摘要
大型语言模型(LLMs)通过提示其分析并修订自身输出来实现自我改进的能力,近期研究已引起显著关注。然而,该能力已被证明在较小模型中缺失且难以习得,从而拉大了最先进LLMs与更具成本效益和更快速模型之间的性能差距。为缩小此差距,我们提出TriPosT,一种赋予较小模型此类自我改进能力的训练算法,并展示我们的方法可将LLaMA-7b在数学与推理任务上的性能提升至多7.13%。与先前工作不同,我们通过让较小模型与LLMs交互以收集对其自身生成内容的反馈与改进来实现这一点,随后回放此经验以训练小模型。我们在四个数学与推理数据集上的实验表明,从自身错误中学习并纠正的交互式经验对小模型提升性能至关重要。
引用
@article{arxiv.2310.13522,
title = {Teaching Language Models to Self-Improve through Interactive Demonstrations},
author = {Xiao Yu and Baolin Peng and Michel Galley and Jianfeng Gao and Zhou Yu},
journal= {arXiv preprint arXiv:2310.13522},
year = {2024}
}
备注
NAACL 2024 main