扩展扩展逻辑:逻辑推理的智能体元综合
人工智能
2026-04-07 v2 计算与语言
机器学习
计算机科学中的逻辑
摘要
基于可验证奖励的强化学习(RLVR)受数据瓶颈制约:现有的合成流程依赖专家编写的代码或固定模板,将增长限制在实例级扰动上。我们将可演化单元从问题实例转移到任务族规范。SSLogic是一个智能体元综合框架,其中LLM智能体在封闭的生成-验证-精炼循环中迭代编写和精炼可执行的生成器-验证器对,产生具有新规则和难度梯度而非旧规则参数变体的任务族。多门验证协议——多策略共识加上对抗性盲审,其中独立智能体通过编写和执行代码解决每个实例——在不适定任务进入训练之前将其过滤。从400个种子族开始,两轮演化产生953个族和21,389个可验证实例。三个收敛比较(步数匹配、令牌匹配和外部Enigmata数据上的规模控制)一致显示演化数据的更高训练效用,在Enigmata上SynLogic +5.2、AIME25 +3.0和BBH +5.5的增益。细粒度KORBench评估揭示了逻辑(+13.2%)和操作(+9.6%)的选择性改进,将结构演化与下游收益联系起来。代码:https://github.com/AdAstraAbyssoque/Scaling-the-Scaling-Logic
引用
@article{arxiv.2602.13218,
title = {Scaling the Scaling Logic: Agentic Meta-Synthesis of Logic Reasoning},
author = {Bowen Liu and Zhi Wu and Runquan Xie and Zhanhui Kang and Jia Li},
journal= {arXiv preprint arXiv:2602.13218},
year = {2026}
}
备注
41 pages, 8 figures, 5 tables in the main body. Project page: https://github.com/AdAstraAbyssoque/Scaling-the-Scaling-Logic, typos corrected, claims cleared