Select2Reason:面向长链思考推理的高效指令微调数据选择
计算与语言
2025-05-26 v1 人工智能
摘要
激活预训练大语言模型中长链思考推理能力的实用方法是对由强型大推理模型(如DeepSeek-R1)合成的指令数据集进行监督式微调,这比强化学习更具成本效益。然而,规模超过10万样本的大型指令集会造成显著的训练开销,而针对自动长链思考指令选择的有效策略仍未探索。本文提出Select2Reason,一种用于长链思考推理的新型且高效指令微调数据选择框架。从自纠正和回溯等思考行为出现的视角,我们研究可能决定长链思考指令质量的常见指标。Select2Reason利用一个量化器估计问题难度,并通过加权方案将基于推理轨迹长度的启发式方法纳入排序,以优先排序高效益示例。在OpenR1-Math-220k数据集上进行的实验表明,在仅使用Select2Reason选择的10%数据上进行微调的LLM,其在三个竞赛级和六个综合数学基准测试上的性能,与完全数据微调或开源基线OpenR1-Qwen-7B相当甚至更好。进一步实验强调了在不同数据规模下的可扩展性、推理期间的效率以及对其他指令池的适应性需要 minimal 成本。
引用
@article{arxiv.2505.17265,
title = {CaseReportBench: An LLM Benchmark Dataset for Dense Information Extraction in Clinical Case Reports},
author = {Xiao Yu Cindy Zhang and Carlos R. Ferreira and Francis Rossignol and Raymond T. Ng and Wyeth Wasserman and Jian Zhu},
journal= {arXiv preprint arXiv:2505.17265},
year = {2025}
}