Datarus-R1:面向自动数据分析的自适应多步骤推理LLM
计算与语言
2025-08-20 v1 人工智能
摘要
我们提出Datarus-R1-14B,这是一个140亿参数的开源权重语言模型,基于Qwen 2.5-14B-Instruct微调,旨在充当虚拟数据分析师和研究生水平问题解决器。Datarus的训练并非在孤立的问答对上进行,而是在包含推理步骤、代码执行、错误追踪、自我纠正和最终结论的完整分析轨迹上进行,所有这些都以ReAct风格的笔记本格式捕获,涵盖金融、医学、数值分析等定量领域。我们的训练管道结合了(1)基于轨迹的合成数据生成器,产生了14.4万个标记化的笔记本情节;(2)双奖励框架,将轻量级基于标记的结构信号与层次化奖励模型(HRM)相结合,后者对单步推理和整体连贯性进行评分;(3)Group Relative Policy Optimization(GRPO)的内存优化实现,特点包括KV缓存复用、顺序生成和参考模型分片。我们采用余弦课程平滑地将注意力从结构忠实性转向语义深度,减少了RL对齐LLM常见的格式崩溃和冗长问题。Datarus的一个核心设计选择是其双重推理界面。在agentic模式下,模型产生带ReAct标记的步骤,可调用Python工具执行实际代码;在反思模式下,它输出以特殊标记 delimit的简洁链式思维(CoT)轨迹。对于挑战性的研究生水平问题,Datarus展现出“AHA时刻”模式:它勾勒假设,最多修改一次或两次,最终收敛,避免了当代系统常见的循环、令牌膨胀问题。跨越标准公共基准测试,Datarus超越了相似规模的模型,甚至达到更大规模推理模型(如QwQ-32B)的水平,在AIME 2024/2025和LiveCodeBench上实现最高可达30%的准确率提升,同时每解答一个问题所发射的token数减少18-49%。
引用
@article{arxiv.2508.13382,
title = {Datarus-R1: An Adaptive Multi-Step Reasoning LLM for Automated Data Analysis},
author = {Ayoub Ben Chaliah and Hela Dellagi},
journal= {arXiv preprint arXiv:2508.13382},
year = {2025}
}