中文

分解式验证:检测并减少学术论文摘要中的幻觉

计算与语言 2023-10-17 v1 人工智能

摘要

幻觉甚至困扰着前沿大语言模型(LLM)——但其在学术论文摘要任务上究竟有多严重?我们评估了分解式验证(Factored Verification),一种用于检测抽取式摘要中幻觉的简单自动化方法。该方法在 HaluEval 基准的摘要任务幻觉检测上确立了新的最优性能(SOTA),准确率达 76.2%。我们随后使用该方法估计语言模型在跨多篇学术论文摘要时产生幻觉的频率,发现平均每次 ChatGPT(16k)摘要有 0.62 处幻觉,GPT-4 为 0.84 处,Claude 2 为 1.55 处。我们让模型利用分解式批评(Factored Critiques)进行自我纠正,发现此举将幻觉数量降至 ChatGPT 0.49 处、GPT-4 0.46 处、Claude 2 0.95 处。我们发现的幻觉往往十分微妙,因此建议在用模型综合学术论文时保持谨慎。

关键词

引用

@article{arxiv.2310.10627,
  title  = {Factored Verification: Detecting and Reducing Hallucination in Summaries of Academic Papers},
  author = {Charlie George and Andreas Stuhlmüller},
  journal= {arXiv preprint arXiv:2310.10627},
  year   = {2023}
}

备注

Second Workshop on Information Extraction from Scientific Publications (WIESP) at IJCNLP-AACL 2023