使用异构反馈微调 LLM 的框架
计算与语言
2024-08-07 v1 机器学习
摘要
大型语言模型 (LLM) 已被应用于各种任务,包括文本摘要、网页导航和聊天机器人。它们从无监督预训练后受益于监督微调 (SFT) 和从人类反馈强化学习 (RLHF)。这些数据集可能难以收集、范围有限且质量参差不齐。此外,数据集在监督格式上差异很大,从数值到二进制以及多维度且有许多不同值。我们提出一个用于使用异构反馈微调 LLM 的框架,其中包含两个主要组件。首先,我们将异构反馈数据整合到单一监督格式中,与 SFT 和 RLHF 等方法兼容。接着,给定这个统一的反馈数据集,我们提取高质量且多样化的子集,以获得可能超过整个数据集的性能提升。我们进行大量实验以了解这些技术在整合异构反馈方面的有效性,并演示了使用高质量和多样化子集的数据的改进。我们发现我们的框架能够同时在多个领域提高模型性能,例如在指令遵循和偏差减少方面。
引用
@article{arxiv.2408.02861,
title = {A Framework for Fine-Tuning LLMs using Heterogeneous Feedback},
author = {Ryan Aponte and Ryan A. Rossi and Shunan Guo and Franck Dernoncourt and Tong Yu and Xiang Chen and Subrata Mitra and Nedim Lipka},
journal= {arXiv preprint arXiv:2408.02861},
year = {2024}
}
备注
7 pages, 1 figure