Minor SFT 损失用于 LLM 微调以提升性能并减少模型偏差
人工智能
2024-08-21 v1 计算与语言
摘要
指令 LLM 是大规模语言模型中用于对齐 LLM 与人类偏好的范式。该范式包含监督微调和基于人类反馈的强化学习。该范式也用于下游场景中以适应 LLM 到特定语料库和应用。与 SFT 相比,许多工作聚焦于 RLHF,并提出了多种算法,如 PPO、DPO、IPO、KTO、MinorDPO 等。同时,大多数 SFT 的工作集中在如何收集、筛选和混合高质量数据。本文在 DPO 和 MinorDPO 的启发下,提出了一种用于 SFT 的训练度量,以衡量优化模型与原始模型之间的差异,以及一种损失函数 MinorSFT,可以提升训练效果,并减少优化 LLM 与原始 LLM 之间的差异。
引用
@article{arxiv.2408.10642,
title = {Minor SFT loss for LLM fine-tune to increase performance and reduce model deviation},
author = {Shiming Xie and Hong Chen and Fred Yu and Zeye Sun and Xiuyu Wu},
journal= {arXiv preprint arXiv:2408.10642},
year = {2024}
}
备注
8 pages, 5 figures