如何利用大语言模型对齐中的演示数据?——基于自我模仿学习的视角
计算与语言
2024-10-15 v1 机器学习
摘要
本文引入一种新型的通用自我模仿学习()框架,有效且高效地将大型语言模型与离线演示数据对齐。我们通过密度比估计推导模仿学习的代理目标,促进使用自生成数据并通过简单的分类损失优化模仿学习目标。消除了标准模仿学习中复杂对抗训练的需求,实现了大型语言模型的轻量级高效微调。此外,包含一系列以通用凸函数为参数化的离线损失,用于密度比估计,实现了与演示数据对齐的统一视图。广泛的实验表明,在诸多具有挑战性的基准测试中 consistently and显著优于基线方法,包括编码(HumanEval)、数学推理(GSM8K)和指令遵循基准(MT-Bench)。
引用
@article{arxiv.2410.10093,
title = {How to Leverage Demonstration Data in Alignment for Large Language Model? A Self-Imitation Learning Perspective},
author = {Teng Xiao and Mingxiao Li and Yige Yuan and Huaisheng Zhu and Chao Cui and Vasant G Honavar},
journal= {arXiv preprint arXiv:2410.10093},
year = {2024}
}
备注
EMNLP 2024 Main