中文

SCAR:基于风格一致性响应排序的数据选择方法用于高效大型语言模型指令调优

计算与语言 2025-06-03 v9

摘要

近期研究强调,手动确保响应风格一致并保持高数据质量在训练集中对微调后的大型语言模型 (LLM) 性能具有显著提升作用,同时还能减少所需的训练示例数量。然而,风格的精确定义以及风格、数据质量与 LLM 性能之间的关系仍不明确。本研究识别了响应中两种关键的风格要素:语言形式和指令惊讶度。我们发现,在质量相当的训练数据中,响应在这些要素上的一致性更高,LLM 性能表现更好。基于此,我们引入基于风格一致性响应排序的数据选择方法 (SCAR),该方法根据响应风格一致性自动优先排序训练集中的指令-响应对。通过选择最具风格一致性的示例,仅使用完整数据集的 0.7% 即可实现微调后的 LLM 在编码和开放式问答基准测试中与在完整数据集上训练的模型等甚至更好。代码和数据可在 https://github.com/zhuang-li/SCAR 获取。

关键词

引用

@article{arxiv.2406.10882,
  title  = {SCAR: Data Selection via Style Consistency-Aware Response Ranking for Efficient Instruction-Tuning of Large Language Models},
  author = {Zhuang Li and Yuncheng Hua and Thuy-Trang Vu and Haolan Zhan and Lizhen Qu and Gholamreza Haffari},
  journal= {arXiv preprint arXiv:2406.10882},
  year   = {2025}
}

备注

35 pages (9th version), developed over 1.5 years. Previously submitted to EMNLP 2024 and ICLR 2025, with revisions based on extensive review feedback. Now accepted to ACL 2025 main