中文

关于指令调谐数据质量报告的严谨性呼吁

计算与语言 2025-05-19 v3 人工智能

摘要

指令调谐是调整大型语言模型(LLMs)以符合用户意图的关键步骤。众多研究强调指令调谐(IT)数据质量的重要性,揭示了 IT 数据质量与 LLMs 对齐性能之间的强相关性。在这些研究中,IT 数据的质量通常通过评估使用该数据训练的 LLMs 的性能来评估。然而,我们发现该做法存在普遍问题:模型训练的超参数往往被任意选择,缺乏充分的依据。我们观察到,即使使用相同数据训练相同模型,不同研究中也存在显著的超参数差异。在本研究中,我们演示了这种做法可能导致的问题,并强调在验证数据质量时需要谨慎考虑。通过对 LIMA 数据质量以及精选的 1,000 条 Alpaca 数据点进行实验,我们展示,任意的超参数决定会使任何任意的结论成为可能。

关键词

引用

@article{arxiv.2503.04807,
  title  = {Call for Rigor in Reporting Quality of Instruction Tuning Data},
  author = {Hyeonseok Moon and Jaehyung Seo and Heuiseok Lim},
  journal= {arXiv preprint arXiv:2503.04807},
  year   = {2025}
}

备注

Accepted to the ACL2025-main