OmniThought:基于详细程度与认知难度注释的大型 CoT 数据集
计算与语言
2025-05-19 v1 人工智能
摘要
大型推理模型( LRM)的出现已通过在数学问题解决和代码生成等复杂任务中卓越表现,变革了自然语言处理领域。这些模型利用链式思维( CoT)过程,使其能够模拟人类式的推理策略。然而,LRM 的发展受限于缺乏全面的 CoT 数据集。当前资源往往未能提供具有连贯 CoT 过程的广泛推理问题,这些过程从多个教师模型中提炼而来,且未考虑描述 CoT 内部特征的多维属性。为此,我们介绍 OmniThought,一个大型数据集,包含由两个强大 LRM 作为教师模型生成并验证的 200 万个 CoT 过程。OmniThought 中的每个 CoT 过程都标注了新的推理详细程度( RV)和认知难度( CD)分数,这些分数描述了 CoT 详细程度和认知难度水平对于模型理解这些推理过程的合适性。我们进一步建立了一个自主管道来策划此数据集。广泛实验表明,我们提出的分数对 LRM 训练效果产生积极影响。基于提出的 OmniThought 数据集,我们进一步训练并发布了一系列高性能 LRM,专为具备更强推理能力以及最佳 CoT 输出长度和难度水平而设计。我们的贡献显著提升了 LRM 在解决复杂任务方面的开发和训练。
引用
@article{arxiv.2505.10937,
title = {Reasoning with OmniThought: A Large CoT Dataset with Verbosity and Cognitive Difficulty Annotations},
author = {Wenrui Cai and Chengyu Wang and Junbing Yan and Jun Huang and Xiangzhong Fang},
journal= {arXiv preprint arXiv:2505.10937},
year = {2025}
}