ThinknCheck:基于紧凑、推理驱动且可解释模型的扎实主张验证
人工智能
2026-04-03 v1 计算与语言
摘要
我们提出ThinknCheck,一个 1B 参数的验证器,用于扎实主张验证,首先生成简短的结构化论证,然后给出二分判断。我们构建 LLMAggreFact-Think,一个源自 LLMAggreFact 的 24.1k 推理增强训练集,并微调 4 位 Gemma3 模型以遵循此格式。在 LLMAggreFact 上,ThinknCheck 实现了 78.1 的平衡准确率(BAcc),超越 MiniCheck-7B(77.4),参数数仅为其 7 倍;移除推理步骤后 BAcc 下降至 57.5。在 SciFact 上,ThinknCheck 达到 64.7 BAcc,比 MiniCheck-7B 提升 14.7。相比之下,base Gemma3-1B 的零样本链式思考反而会损害准确率,而简单格式+准确率奖励的偏好优化在受监督推理方面表现不佳。为探索后者,我们引入 GSMClaims 和一个面向领域的变体ThinknCheck-Science,该变体在各类基准测试中均取得改善,包括在 GSMClaims 上达到 61.0% 的准确率。总体而言,显式的、受监督的推理使紧凑验证器在保持资源高效和可解释性的同时与竞争性相当。
关键词
引用
@article{arxiv.2604.01652,
title = {ThinknCheck: Grounded Claim Verification with Compact, Reasoning-Driven, and Interpretable Models},
author = {Delip Rao and Feijiang Han and Chris Callison-Burch},
journal= {arXiv preprint arXiv:2604.01652},
year = {2026}
}
备注
15 pages