用于忠实且抽象对话生成的弹性权重移除方法
计算与语言
2023-03-31 v1 人工智能
机器学习
摘要
理想情况下,对话系统应生成忠实于相关文档所含知识的回复。然而,许多模型反而生成与文档矛盾或包含无法验证信息的幻觉回复。为缓解此类不良行为,已有研究提出在负例上微调一个“负专家”并将其参数从预训练模型参数中减去。但直观来看,这未考虑到某些参数比其他参数更易引发幻觉。因此,我们提议通过(对)Fisher信息矩阵(其衡量参数估计的不确定性)的近似来权衡各参数的个体重要性。我们将此方法称为弹性权重移除(EWR)。我们使用不同变体的Flan-T5作为主干语言模型,在多个信息寻求对话生成数据集上评估了我们的方法,并与CTRL、Quark、DExperts和Noisy Channel重排序等最先进的忠实性技术进行比较。大量自动与人工评估表明,EWR以其他指标上的微小代价系统性地提升了忠实性。然而,我们注意到仅抑制幻觉可能增加抽取性,即浅层复制粘贴文档片段,这可能并不可取。因此,作为第二项主要贡献,我们展示了可将本方法扩展为同时抑制幻觉与抽取性回复。我们公开了复现EWR及所有基线的代码。
引用
@article{arxiv.2303.17574,
title = {Elastic Weight Removal for Faithful and Abstractive Dialogue Generation},
author = {Nico Daheim and Nouha Dziri and Mrinmaya Sachan and Iryna Gurevych and Edoardo M. Ponti},
journal= {arXiv preprint arXiv:2303.17574},
year = {2023}
}