RATIONALYST:从无标签数据中挖掘隐式理由以进行推理过程监督
人工智能
2025-06-17 v2 计算与语言
摘要
LLM 生成的推理步骤可能不完整,因为它们模仿其预训练数据中常见的日常交流中的逻辑跳跃:潜在的理由经常被隐含(未明确说明)。为解决这一挑战,我们引入 RATIONALYST,这是一个基于从无标签数据中提取的大量理由注释进行预训练的过程监督推理模型。我们从 web 规模的无标签数据集(the Pile)和结合最小人工干预的推理数据集中提取 79k 条理由注释。这种 web 规模的预训练推理允许 RATIONALYST 在包括数学、常识、科学和逻辑推理在内的多种推理任务中实现一致的泛化。基于 LLaMa-3-8B 微调的 RATIONALYST 在 7 个代表性推理基准测试中平均提高了 3.9% 的准确率。它还显示出优于显著更大验证器(如 GPT-4)和同样大小的模型(在匹配训练集上微调)的优异性能。
引用
@article{arxiv.2410.01044,
title = {RATIONALYST: Mining Implicit Rationales for Process Supervision of Reasoning},
author = {Dongwei Jiang and Guoxuan Wang and Yining Lu and Andrew Wang and Jingyu Zhang and Chuyu Liu and Benjamin Van Durme and Daniel Khashabi},
journal= {arXiv preprint arXiv:2410.01044},
year = {2025}
}
备注
Our code, data, and model can be found at this repository: https://github.com/JHU-CLSP/Rationalyst