中文

GripRank:通过生成式知识改进段落排序弥合检索与生成之间的鸿沟

计算与语言 2023-08-16 v2 人工智能

摘要

检索增强文本生成在知识密集型语言任务(如开放域问答和知识增强对话生成)上取得了显著进展,其利用从大型段落语料库中检索出的段落,针对给定输入查询给出恰当回答。然而,检索出的段落并不理想,不足以引导答案生成,因为检索与生成之间存在差异,即候选段落在检索过程中被平等对待,而未考虑其生成恰当答案的潜力。这一差异使得段落检索器向答案生成交付了次优的候选段落集合。本文中,我们提出生成式知识改进段落排序(GripRank)方法,通过将知识从生成式段落估计器(GPE)蒸馏到段落排序器来解决上述挑战,其中 GPE 是用于度量候选段落生成恰当答案可能性的生成式语言模型。我们通过教导段落排序器学习对由 GPE 排序的段落进行排序来实现蒸馏过程。此外,我们设计课程知识蒸馏机制以提升蒸馏质量,该机制允许 GPE 提供的知识通过由易到难的课程逐步蒸馏至排序器,使段落排序器能从众多看似合理的候选中正确识别答案出处。我们在跨越三种知识密集型语言任务的四个数据集上进行了广泛实验。实验结果表明,在 KILT 基准上,无论是段落排序还是答案生成,均优于最先进(SOTA)方法。

关键词

引用

@article{arxiv.2305.18144,
  title  = {GripRank: Bridging the Gap between Retrieval and Generation via the Generative Knowledge Improved Passage Ranking},
  author = {Jiaqi Bai and Hongcheng Guo and Jiaheng Liu and Jian Yang and Xinnian Liang and Zhao Yan and Zhoujun Li},
  journal= {arXiv preprint arXiv:2305.18144},
  year   = {2023}
}

备注

CIKM 2023