中文

指令微调:提示词损失是否重要?

机器学习 2024-10-15 v4 人工智能 计算与语言

摘要

我们提出了一项新颖的研究,分析了监督指令微调(SIFT)中不同提示词损失 token 权重(PLW)的影响。虽然提示词掩码(PLW = 0)在 SIFT 中很常见,但一些微调 API 支持小数 PLW,并建议在短补全数据上进行微调时,使用较小的非零 PLW 有助于稳定学习。然而,此前从未有研究证实这一说法,且主要的云端 SIFT 提供商 OpenAI 最近从其微调 API 中移除了该参数。我们发现,在短补全数据上微调的模型,其性能与 PLW 之间存在具有统计显著性的负二次关系。使用较小的 PLW 值(0.01 - 0.5)在多选题和短文本生成基准上产生了更好的结果(优于在长补全数据上微调的模型),而较大的 PLW 值(~ 1.0)在长文本生成基准上产生了更好的结果。我们解释了这一效应,并通过额外实验验证了其重要性。本研究对 API 提供商起到了警示作用,提醒其在 SIFT 中提供 PLW 参数的重要性。

关键词

引用

@article{arxiv.2401.13586,
  title  = {Instruction Fine-Tuning: Does Prompt Loss Matter?},
  author = {Mathew Huerta-Enochian and Seung Yong Ko},
  journal= {arXiv preprint arXiv:2401.13586},
  year   = {2024}
}

备注

EMNLP 2024: Camera-ready version