SAIE 框架:仅支持不足够——通过对抗评论推进 LLM 训练
计算与语言
2024-03-04 v2
摘要
大语言模型(LLMs)可以通过与其他模型或人类的讨论来论证或批评其预测,从而丰富其对实例的内在理解。虽然推理阶段中的主动讨论已被证明能提升性能,但此类交互在训练阶段尚未得到广泛探索。我们假设将交互式讨论纳入训练过程能够增强模型的理解,并改善其在推理阶段的推理和语言表达能力。本工作介绍了 SAIE 框架,它促进了学习器模型与伙伴模型之间的支持性和对抗性讨论。学习器模型接收来自伙伴的响应,并随后基于该讨论更新其参数。这一动态调整过程在整个训练阶段持续进行,以响应学习器模型不断演化的输出。我们在包括数学问题、常识推理和多领域知识在内的各项任务上的实证评估表明,使用 SAIE 框架微调的模型优于采用常规微调方法的模型。此外,我们的方法增强了模型的推理能力,提升了个体和多智能体推理性能。
引用
@article{arxiv.2311.08107,
title = {SAIE Framework: Support Alone Isn't Enough -- Advancing LLM Training with Adversarial Remarks},
author = {Mengsay Loem and Masahiro Kaneko and Naoaki Okazaki},
journal= {arXiv preprint arXiv:2311.08107},
year = {2024}
}