中文

以知识增强大语言模型:关于幻觉抑制的综述

计算与语言 2023-09-29 v1 人工智能 机器学习

摘要

大型预训练语言模型已展现出将其事实知识存储于参数中的能力,并在针对下游自然语言处理任务微调时取得显著成果。然而,它们精确访问与操控知识的能力仍受限制,导致在知识密集型任务上相较于任务特定架构存在性能差距。此外,为模型决策提供出处以及维持最新的世界知识等挑战仍是开放的研究前沿。为应对这些局限,将预训练模型与指向显式非参数记忆的可微分访问机制相整合成为一种有前景的方案。本综述深入探讨具备调用外部知识源(包括外部知识库与搜索引擎)能力的语言模型(LMs)。在遵循预测缺失词元的标准目标的同时,这些增强型 LM 利用多样的、可能是非参数的外部模块来增强其上下文处理能力,从而偏离传统的语言建模范式。通过探究当前以知识增强大语言模型(LLM)的进展,本工作得出结论:这一新兴研究方向有望解决传统 LM 中的普遍问题,如幻觉、无依据响应以及可扩展性挑战。

关键词

引用

@article{arxiv.2309.16459,
  title  = {Augmenting LLMs with Knowledge: A survey on hallucination prevention},
  author = {Konstantinos Andriopoulos and Johan Pouwelse},
  journal= {arXiv preprint arXiv:2309.16459},
  year   = {2023}
}