中文

SynClaimEval:用于长上下文主张验证中合成数据实用性评估的框架

计算与语言 2025-11-13 v1

摘要

拥有扩展上下文窗口的大型语言模型(LLM)承诺能够直接对长文档进行推理,从而减少对分块或检索的需求。然而,构建用于训练和评估的标注资源仍然昂贵。合成数据提供了可扩展的替代方案,我们介绍 SynClaimEval,这是一个用于评估合成数据在长上下文主张验证中的实用性的框架——这是一项核心任务,关乎幻觉检测和事实核查。我们的框架检查三个维度:(i) 输入特征,通过变化上下文长度并测试对 out-of-domain 基准的泛化;(ii) 合成逻辑,通过控制主张复杂度和错误类型变化;(iii) 解释质量,衡量模型解释在多大程度上提供与预测一致的证据。跨基准的实验表明,长上下文合成数据可提高基础指令调优模型的验证效果,特别是在增强现有人工编写数据集时效果尤为显著。此外,合成数据虽然在验证得分上未必提升,却显著增强了解释质量,这凸显了其潜在的提升性能和可解释性的作用。

关键词

引用

@article{arxiv.2511.09539,
  title  = {SynClaimEval: A Framework for Evaluating the Utility of Synthetic Data in Long-Context Claim Verification},
  author = {Mohamed Elaraby and Jyoti Prakash Maheswari},
  journal= {arXiv preprint arXiv:2511.09539},
  year   = {2025}
}