中文

HypoTermQA:用于基准测试 LLM 幻觉倾向的假设术语数据集

计算与语言 2024-02-27 v1

摘要

幻觉对大型语言模型(LLM)的可靠性和对齐性构成了重大挑战,限制了其在聊天机器人应用之外的广泛接受。尽管 ongoing 努力不断,幻觉仍然是 LLM 中普遍存在的挑战。幻觉检测本身也是一项艰巨的任务,通常需要人工标注或受限的评估。本文介绍了一个自动化的可扩展框架,将 LLM 幻觉倾向的基准测试与高效的幻觉检测相结合。我们利用 LLM 生成与假设现象相关的挑战性任务,随后将其用作代理以进行高效的幻觉检测。该框架与领域无关,允许在任何领域使用任何语言模型进行基准创建或评估。我们推出了公开可用的 HypoTermQA 基准数据集,在该数据集上,最先进模型的性能介于 3% 至 11% 之间,而评估代理在幻觉预测中的错误率为 6%。所提出的框架为测试和改进 LLM 提供了机会。此外,它还有潜力生成针对特定领域(如法律、健康和金融)定制的基准数据集。

关键词

引用

@article{arxiv.2402.16211,
  title  = {HypoTermQA: Hypothetical Terms Dataset for Benchmarking Hallucination Tendency of LLMs},
  author = {Cem Uluoglakci and Tugba Taskaya Temizel},
  journal= {arXiv preprint arXiv:2402.16211},
  year   = {2024}
}

备注

EACL SRW 2024 Camera Ready