中文

Reasoning-CV:微调强大推理 LLM 以进行知识辅助的主张验证

人工智能 2025-05-20 v1

摘要

主张验证是应对虚假信息的关键环节,大型语言模型(LLM)最近在该领域作为强大的工具出现,用于利用外部知识来评估主张的真实性。现有的 LLM-based 主张验证方法通常采用分解-验证范式,即将复杂主张分解为几个独立的子主张并分别验证每个子主张。然而,这种范式常在主张分解过程中引入错误。为缓解这些错误,我们提出开发链式思考(Chain-of-Thought, CoT)-验证范式,该范式利用 LLM 推理方法为原始复杂主张生成 CoT 验证路径,而无需分解为子主张和单独的验证阶段。CoT-验证范式使我们能够提出一种称为 Reasoning-CV 的自然微调方法,以增强 LLM 的验证能力。Reasoning-CV包括监督微调(SFT)阶段和自我改进直接偏好优化(DPO)阶段。仅使用 8B 参数的预训练 LLM,Reasoning-CV 在知识辅助主张验证方面表现出优于现有分解-验证方法的优越性能,以及强大的黑箱 LLM 如 GPT-4o+CoT 和 o1-preview。我们的代码已公开。

关键词

引用

@article{arxiv.2505.12348,
  title  = {Reasoning-CV: Fine-tuning Powerful Reasoning LLMs for Knowledge-Assisted Claim Verification},
  author = {Zhi Zheng and Wee Sun Lee},
  journal= {arXiv preprint arXiv:2505.12348},
  year   = {2025}
}