DecomposeRL: 学习提出有用、信息丰富且多样的问题以实现半监督、可追溯的声明验证
计算与语言
2026-05-28 v1 人工智能
机器学习
摘要
声明验证在端到端分类器(准确但无法产生可检查的追溯路径)和基于分解的方法(能产生可检查的追溯路径但在基准数据集上性能落后)之间摇摆。我们提出DecomposeRL,一个能产生可检查追溯路径的准确声明验证器。DecomposeRL将分解问题框架化为一个使用GRPO和多方面奖励集成训练的强化学习策略,从而能够从无标签声明中进行全监督和半监督学习。DecomposeRL通过一个数据筛选漏斗解决了GRPO高昂的训练成本问题,该漏斗将115K条事实验证声明提炼成一个紧凑的、富含学习信号的5K条声明的子集。我们表明,仅在约5K条精选声明上进行全监督训练的DecomposeRL-7B策略,在包含生物医学、政治、科学和通用领域声明的11个声明验证基准上,达到了86.3的域内和69.8的域外平衡准确率。尽管模型大小是其四分之一,但它与32B基线和GPT-4.1-mini性能相当,并且在仅使用10%标签声明数据的半监督设置中进一步优于基线。代码、数据和模型可在 https://dipta007.github.io/DecomposeRL 获取。
引用
@article{arxiv.2605.27858,
title = {DecomposeRL: Learning to Ask Useful, Informative, and Diverse Questions for Semi-Supervised, Traceable Claim Verification},
author = {Shubhashis Roy Dipta and Ankur Padia and Francis Ferraro},
journal= {arXiv preprint arXiv:2605.27858},
year = {2026}
}