从“愚蠢”问题中学习可以略微提升大语言模型性能
计算与语言
2024-11-22 v1
摘要
构建高质量的监督微调(SFT)数据集是大语言模型(LLM)训练的关键。近期研究表明,使用来自特定来源(Ruozhiba)的数据——该网站用户提出“愚蠢”问题以更好地理解某些主题——可导致更好的微调性能。本文旨在探索其成功背后的隐藏因素及大规模评估其性能。首先,我们利用 GPT-4 从 Ruozhiba 提问的成功案例中,从教育、心理和认知科学的角度进行分析,提炼出一组解释性规则。随后,我们通过应用这些规则来构建 MMLU 训练集的微调数据集。令人惊讶的是,我们的结果表明,这些规则在某些任务中显著提升模型性能,同时也可能在其他任务中导致性能下降。例如,遵循“反直觉思维”规则生成的 SFT 数据可在“全球事实”任务中实现约 5% 的提升,而“模糊概念边界”规则则导致“计量经济学”任务出现 6.14% 的性能下降。此外,针对特定任务,不同规则对模型性能的影响趋于一致。这表明提炼出的规则之间的差异并不显著,规则的有效性在不同任务间相对一致。我们的研究强调,在构建 SFT 数据集时需考虑任务多样性和规则适用性,以实现更全面的性能提升。
引用
@article{arxiv.2411.14121,
title = {Learning from "Silly" Questions Improves Large Language Models, But Only Slightly},
author = {Tingyuan Zhu and Shudong Liu and Yidong Wang and Derek F. Wong and Han Yu and Takahiro Shinozaki and Jindong Wang},
journal= {arXiv preprint arXiv:2411.14121},
year = {2024}
}
备注
27 pages, 14 figures