从 LLM 自适应问题难度评分角度重新思考高质量链式思维数据生成
人工智能
2025-04-17 v1
摘要
最近,DeepSeek-R1 (671B) (DeepSeek-AI et al., 2025) 在复杂任务中展现出卓越的推理能力,并公开了其方法。这为激发小型大语言模型 (LLM) 的推理能力提供了潜在的高质量链式思维 (CoT) 数据。为了为不同 LLM 生成高质量 CoT 数据,我们寻求一种高效的方法,以 LLM 自适应问题难度水平生成高质量 CoT 数据。首先,根据 LLM 自身的推理能力对问题进行难度评分,并构建 LLM 自适应问题数据库。其次,依据问题难度水平的分布对问题数据库进行采样,然后使用 DeepSeek-R1 (671B) (DeepSeek-AI et al., 2025) 生成相应的高质量 CoT 数据及正确答案。通过构建具有 LLM 自适应难度水平的 CoT 数据,显著降低了数据生成成本,提高了模型监督微调 (SFT) 的效率。最后,我们在复杂数学竞赛和代码生成任务领域验证了所提出方法的有效性与通用性。值得注意的是,仅凭 2k 条高质量数学 CoT 数据,我们的 ZMath-32B 就超过了 DeepSeek-Distill-32B 在数学推理任务中的表现。同样,仅凭 2k 条高质量代码 CoT 数据,我们的 ZCode-32B 也超过了 DeepSeek-Distill-32B 在代码推理任务中的表现。
引用
@article{arxiv.2504.11919,
title = {Rethinking the Generation of High-Quality CoT Data from the Perspective of LLM-Adaptive Question Difficulty Grading},
author = {Qianjin Yu and Keyu Wu and Zihan Chen and Chushu Zhang and Manlin Mei and Lingjun Huang and Fang Tan and Yongsheng Du and Kunlin Liu and Yurui Zhu},
journal= {arXiv preprint arXiv:2504.11919},
year = {2025}
}