English

Distill and Align Decomposition for Enhanced Claim Verification

Artificial Intelligence 2026-02-26 v1 Computation and Language Machine Learning

Abstract

Complex claim verification requires decomposing sentences into verifiable subclaims, yet existing methods struggle to align decomposition quality with verification performance. We propose a reinforcement learning (RL) approach that jointly optimizes decomposition quality and verifier alignment using Group Relative Policy Optimization (GRPO). Our method integrates: (i) structured sequential reasoning; (ii) supervised finetuning on teacher-distilled exemplars; and (iii) a multi-objective reward balancing format compliance, verifier alignment, and decomposition quality. Across six evaluation settings, our trained 8B decomposer improves downstream verification performance to (71.75%) macro-F1, outperforming prompt-based approaches ((+1.99), (+6.24)) and existing RL methods ((+5.84)). Human evaluation confirms the high quality of the generated subclaims. Our framework enables smaller language models to achieve state-of-the-art claim verification by jointly optimising for verification accuracy and decomposition quality.

Keywords

Cite

@article{arxiv.2602.21857,
  title  = {Distill and Align Decomposition for Enhanced Claim Verification},
  author = {Jabez Magomere and Elena Kochkina and Samuel Mensah and Simerjot Kaur and Fernando Acero and Arturo Oncevay and Charese H. Smiley and Xiaomo Liu and Manuela Veloso},
  journal= {arXiv preprint arXiv:2602.21857},
  year   = {2026}
}

Comments

EACL Findings 2026

R2 v1 2026-07-01T10:51:52.965Z