上下文质量在训练用于抽取式开放域问答的Fusion-in-Decoder中至关重要
计算与语言
2024-03-22 v1
摘要
检索增强生成模型通过在生成过程中提供额外相关外部知识(上下文)来增强语言模型中编码的知识。尽管已有研究表明上下文的数量和质量会影响检索增强生成模型在推理时的性能,但关于这些特征如何影响模型训练的研究有限。本文探讨了模型训练过程中上下文的数量和质量如何影响Fusion-in-Decoder (FiD)(最先进的检索增强生成模型)在抽取式开放域问答任务中的性能。实验结果表明,FiD模型在训练过程中对上下文质量过拟合,当在不同上下文质量下评估时表现出次优性能。通过实验结果,我们还揭示了用不同上下文质量训练的FiD模型具有不同的交叉注意力分布模式。具体来说,随着训练过程中上下文质量的提高,FiD模型倾向于更均匀地关注上下文中的每个段落。最后,基于这些观察,我们提出了一种通过向交叉注意力分布引入偏差来缓解对特定上下文质量过拟合的方法,我们证明该方法能有效提高FiD模型在不同上下文质量下的性能。
引用
@article{arxiv.2403.14197,
title = {Context Quality Matters in Training Fusion-in-Decoder for Extractive Open-Domain Question Answering},
author = {Kosuke Akimoto and Kunihiro Takeoka and Masafumi Oyamada},
journal= {arXiv preprint arXiv:2403.14197},
year = {2024}
}
备注
EMNLP Findings 2023