基于因果推理的 RLVR 泛化性研究
机器学习
2026-03-05 v2 人工智能
计算与语言
摘要
基于可验证奖励的强化学习 (RLVR) 已成为后训练大型语言模型 (LLM) 以解决复杂推理任务的有前景的方法之一。然而,RLVR 何种条件下才能实现稳健的泛化性仍存未知。本文对 RLVR 在概率推理因果图模型环境下的泛化性进行实证研究。该环境提供了两个自然的泛化维度:(i) 概率查询的层次——关联型、干预型或反事实型;(ii) 查询结构复杂性——由其相关子图大小衡量。我们构建了一个覆盖这些难度维度的因果图和查询数据集,并使用 RLVR 或监督微调 (SFT) 对 Qwen-2.5-Instruct 模型进行微调。我们变更模型规模 (3B-32B) 和训练查询层次。我们发现,仅在特定的模型规模和训练查询层次组合时,RLVR 才能在同一层次内和跨层次实现比 SFT 更强的泛化。进一步分析表明,RLVR 的有效性取决于模型的初始推理能力。当初始能力足够时,RLVR 可改进模型的边缘化策略,减少中间概率计算中的错误,从而在更复杂查询上实现显著的准确率提升。这些结果表明,RLVR 可提升特定因果推理子技能,其优势仅在模型具备足够初始能力时才会显现。我们的代码和数据已公开于 https://github.com/zhichul/rlcausal。
引用
@article{arxiv.2512.20760,
title = {Generalization of RLVR Using Causal Reasoning as a Testbed},
author = {Brian Lu and Hongyu Zhao and Shuo Sun and Hao Peng and Rui Ding and Hongyuan Mei},
journal= {arXiv preprint arXiv:2512.20760},
year = {2026}
}