中文

ACL期刊的误报(CAP):用于科学幻觉检测的数据集

计算与语言 2025-10-28 v1

摘要

我们介绍了CAP(Confabulations from ACL Publications,即ACL期刊中的误报)数据集,这是一个用于研究大型语言模型(LLM)在科学文本生成中幻觉现象的多语言资源。CAP聚焦于科学领域,在该领域,幻觉会扭曲事实知识,因而尤为突出。由于该领域存在专业术语、统计推理和情境依赖性解释,这些扭曲在LLM缺乏真正理解、有限的情境理解以及对表层泛化偏向的背景下尤为严重。CAP在跨语言环境中覆盖五种高资源语言(英语、法语、印地语、意大语和西班牙语)和四种低资源语言(孟加拉语、古地亚语、马来语和泰米尔语)。数据集包含900个精选科学问题和超过7000个来自16个公开模型的LLM生成答案,以问题-答案对形式提供,包括标记序列和相应的logits。每个实例都标注了是否存在科学幻觉(称为事实错误)的二元标签,以及流畅性标签,后者捕捉文本语言质量或自然性方面的问题。CAP已公开发布,以促进幻觉检测、LLM的多语言评估以及更可靠的科学NLP系统的开发。

关键词

引用

@article{arxiv.2510.22395,
  title  = {Confabulations from ACL Publications (CAP): A Dataset for Scientific Hallucination Detection},
  author = {Federica Gamba and Aman Sinha and Timothee Mickus and Raul Vazquez and Patanjali Bhamidipati and Claudio Savelli and Ahana Chattopadhyay and Laura A. Zanella and Yash Kankanampati and Binesh Arakkal Remesh and Aryan Ashok Chandramania and Rohit Agarwal and Chuyuan Li and Ioana Buhnila and Radhika Mamidi},
  journal= {arXiv preprint arXiv:2510.22395},
  year   = {2025}
}