C-FAITH:面向自动幻觉评估的中文细粒度基准
计算与语言
2025-04-15 v1 人工智能
摘要
尽管大型语言模型取得了快速的进展,但它们仍然高度易于生成幻觉内容,这显著阻碍了其广泛应用。幻觉研究需要动态且细粒度的评估。然而,现有的大多数幻觉基准(尤其是在中文语言领域)依赖于人工标注,使得自动化和高效的幻觉评估具有挑战。为此,我们引入 HaluAgent——一个基于部分知识文档构建细粒度问答数据集的代理框架。我们的实验表明,手动设计的规则和提示优化可提高生成数据的质量。通过 HaluAgent,我们构建了 C-FAITH,一个源自 1,399 份从网页抓取获得的知识文档,总计 60,702 条条目的中文问答幻觉基准。我们对 16 个主流大语言模型进行了使用 C-FAITH 的全面评估,提供了详细的实验结果与分析。
引用
@article{arxiv.2504.10167,
title = {C-FAITH: A Chinese Fine-Grained Benchmark for Automated Hallucination Evaluation},
author = {Xu Zhang and Zhifei Liu and Jiahao Wang and Huixuan Zhang and Fan Xu and Junzhe Zhang and Xiaojun Wan},
journal= {arXiv preprint arXiv:2504.10167},
year = {2025}
}