中文

CoT-Self-Instruct:基于链式思维构建推理与非推理任务的高质量合成提示

人工智能 2025-09-04 v2 计算与语言

摘要

我们提出了 CoT-Self-Instruct 方法,用于生成高质量的合成数据。该方法指示大语言模型(LLM)首先通过链式思维(Chain-of-Thought, CoT)进行推理和计划,然后生成与给定种子任务相似质量和复杂度的新合成示例。随后通过自动化指标进行数据筛选,筛选后的高质量数据用于 LLM 训练。在可验证的推理任务上,我们的方法在 MATH500、AMC23、AIME24 和 GPQA-Diamond 等数据集上显著优于现有的训练数据集,如 s1k 和 OpenMathReasoning。对于非可验证的指令遵循任务,本方法在 AlpacaEval 2.0 和 Arena-Hard 基准上超越了人类和标准 Self-Instruct 训练数据的性能。

关键词

引用

@article{arxiv.2507.23751,
  title  = {CoT-Self-Instruct: Building high-quality synthetic prompts for reasoning and non-reasoning tasks},
  author = {Ping Yu and Jack Lanchantin and Tianlu Wang and Weizhe Yuan and Olga Golovneva and Ilia Kulikov and Sainbayar Sukhbaatar and Jason Weston and Jing Xu},
  journal= {arXiv preprint arXiv:2507.23751},
  year   = {2025}
}