训练语言模型以经核实的引文支撑回答
计算与语言
2022-03-22 v1 机器学习
摘要
近期的大型语言模型往往能正确回答事实性问题。但用户若不加以事实核查,便无法信任模型给出的任一断言,因为语言模型可能生成看似可信的胡言乱语。本文利用基于人类偏好的强化学习(RLHP)训练“开卷”问答模型,其在生成答案的同时引用具体证据来支撑断言,从而有助于评估正确性。支撑证据取自通过搜索引擎找到的多个文档,或单个用户提供的文档。我们具有 2800 亿参数的模型 GopherCite 能够生成带有高质量支撑证据的答案,并在不确定时拒答。我们通过人工评估 GopherCite 在 NaturalQuestions 与 ELI5 数据集子集上问题的回答来度量其表现。在该 Natural Questions 子集上,模型回答被发现 80% 的时间质量较高,在 ELI5 子集上为 67%。对最不确定的三分之一问题拒答后,表现分别提升至 90% 与 80%,接近人类基线。然而,在对抗性的 TruthfulQA 数据集上的分析表明,为何引文仅是整体安全性与可信赖策略的一部分:并非所有有证据支撑的断言皆为真实。
引用
@article{arxiv.2203.11147,
title = {Teaching language models to support answers with verified quotes},
author = {Jacob Menick and Maja Trebacz and Vladimir Mikulik and John Aslanides and Francis Song and Martin Chadwick and Mia Glaese and Susannah Young and Lucy Campbell-Gillingham and Geoffrey Irving and Nat McAleese},
journal= {arXiv preprint arXiv:2203.11147},
year = {2022}
}