中文

超越事实性:作为知识生成器的大语言模型综合评估

计算与语言 2023-10-12 v1

摘要

大语言模型(LLMs)在被提示生成世界知识时,在下游知识密集型任务上的表现优于信息检索技术。然而,社区对于使用这种未经审查的知识的事实性及其潜在影响存在大量担忧。有鉴于此,我们引入 CONNER,一个综合知识评估框架(COmpreheNsive kNowledge Evaluation fRamework),旨在从六个重要视角——事实性、相关性、连贯性、信息量、有用性与有效性——系统且自动地评估生成的知识。我们在两个被广泛研究的知识密集型任务(即开放域问答与知识增强对话)上,对三类不同 LLM 所生成知识进行了广泛的实证分析。令人惊讶的是,我们的研究表明,即便生成知识的事实性较低,也并未显著阻碍下游任务。相反,输出的相关性与连贯性比微小的事实错误更为重要。进一步,我们展示了如何通过设计两种策略——提示工程(Prompt Engineering)与知识选择——来利用 CONNER 改进知识密集型任务。我们的评估代码以及带有人工标注的 LLM 生成知识将被发布以促进未来研究。

关键词

引用

@article{arxiv.2310.07289,
  title  = {Beyond Factuality: A Comprehensive Evaluation of Large Language Models as Knowledge Generators},
  author = {Liang Chen and Yang Deng and Yatao Bian and Zeyu Qin and Bingzhe Wu and Tat-Seng Chua and Kam-Fai Wong},
  journal= {arXiv preprint arXiv:2310.07289},
  year   = {2023}
}

备注

Accepted to EMNLP 2023 main conference