SelectIT:通过不确定性感知自反思实现大语言模型的选择性指令微调
计算与语言
2025-01-16 v2 人工智能
机器学习
摘要
指令微调 (IT) 对于定制大语言模型 (LLMs) 以面向人类的交互至关重要。近期的进展表明,精心挑选一小部分高质量 IT 数据可以显著提升 LLMs 的性能。尽管如此,常见方法往往依赖额外的模型或数据,这增加了成本并限制了广泛采用。在本文中,我们提出了一种名为 SelectIT 的新方法,该方法利用 LLM 本身的基础能力。具体而言,我们利用 LLM 中固有的不确定性来更有效地选择高质量 IT 数据,而无需额外资源。此外,我们引入了一个经过策划的 IT 数据集 Selective Alpaca,它是通过将 SelectIT 应用于 Alpaca-GPT4 数据集而创建的。实证结果表明,使用 Selective Alpaca 进行 IT 能显著增强模型能力。SelectIT 的鲁棒性也在各种基础模型和特定领域任务中得到了证实。我们的发现表明,更长且计算密集的 IT 数据可能是更优质的 IT 来源,为该领域的未来研究提供了有价值的见解。数据、代码和脚本可在 https://github.com/Blue-Raincoat/SelectIT 免费获取。
引用
@article{arxiv.2402.16705,
title = {SelectIT: Selective Instruction Tuning for LLMs via Uncertainty-Aware Self-Reflection},
author = {Liangxin Liu and Xuebo Liu and Derek F. Wong and Dongfang Li and Ziyi Wang and Baotian Hu and Min Zhang},
journal= {arXiv preprint arXiv:2402.16705},
year = {2025}
}
备注
Accepted to NeurIPS 2024