用于增强主张验证的分解对齐蒸馏
人工智能
2026-02-26 v1 计算与语言
机器学习
摘要
复杂的主张验证需要将句子分解为可验证的子主张,但现有方法在分解质量与验证性能之间对齐方面存在挑战。我们提出了一种强化学习(RL)方法,通过组相对策略优化(GRPO)联合优化分解质量和验证器对齐。我们的方法集成了:(i)结构化的顺序推理;(ii)针对教师蒸馏范例的监督微调;以及(iii)一种多目标奖励,用于平衡格式合规性、验证器对齐和分解质量。 在六个评估设置下,我们训练的8B模型在下游验证性能上达到(71.75%)宏平均F1,超过基于提示的方法(提升1.99,6.24)和现有RL方法(提升5.84)。人类评估确认生成子主张的高质量。我们的框架使较小的语言模型能够通过联合优化验证准确性和分解质量来实现状态突破的主张验证。
引用
@article{arxiv.2602.21857,
title = {Distill and Align Decomposition for Enhanced Claim Verification},
author = {Jabez Magomere and Elena Kochkina and Samuel Mensah and Simerjot Kaur and Fernando Acero and Arturo Oncevay and Charese H. Smiley and Xiaomo Liu and Manuela Veloso},
journal= {arXiv preprint arXiv:2602.21857},
year = {2026}
}
备注
EACL Findings 2026