中文

RAISE:面向大语言模型的强化自适应指令选择

计算与语言 2026-02-16 v5

摘要

在大语言模型(LLM)的指令微调中,人们普遍认识到少量高质量指令优于大量低质量指令。目前已提出许多指令选择方法,但大多数方法基于启发式质量指标选择指令,且仅考虑训练前的数据选择。这导致指令微调优化不足,固定的启发式指标常难以针对特定任务进行优化。因此,我们设计了一种动态、以任务目标为导向的指令选择框架 RAISE(Reinforced Adaptive Instruction SElection),将整个指令微调过程纳入优化,在每个步骤根据每条指令对模型性能提升的预期影响进行选择。我们的方法具有良好的可解释性,具备强大的任务特定优化能力。通过将动态指令选择建模为序列决策过程,我们使用强化学习来训练我们的选择策略。大量实验和结果分析证明了我们方法的优越性。值得注意的是,RAISE 仅通过更新 1% 的训练步骤即可实现超越全数据训练的优异性能,显示现其效率和效果。

关键词

引用

@article{arxiv.2504.07282,
  title  = {RAISE: Reinforced Adaptive Instruction Selection For Large Language Models},
  author = {Qingsong Lv and Yangning Li and Zihua Lan and Zishan Xu and Jiwei Tang and Tingwei Lu and Yinghui Li and Wenhao Jiang and Hong-Gee Kim and Hai-Tao Zheng and Philip S. Yu},
  journal= {arXiv preprint arXiv:2504.07282},
  year   = {2026}
}

备注

Accepted by EMNLP 2025 findings