揭开魔法:探究检索增强生成中的注意力蒸馏
计算与语言
2024-02-20 v1 信息检索
摘要
检索增强生成框架可以通过实现实时知识更新以获得更准确的答案,从而解决大语言模型的局限性。在检索增强模型的训练阶段,一种高效的方法是注意力蒸馏,它使用注意力分数作为监督信号,而不是手动标注的查询-文档对。尽管其日益流行,但注意力蒸馏成功背后的详细机制仍未得到探索,特别是它利用哪些特定模式来有益于训练。在本文中,我们通过全面回顾注意力蒸馏工作流程并识别影响检索增强语言模型学习质量的关键因素,来填补这一空白。我们进一步提出了优化模型训练方法和避免无效训练的指标。
引用
@article{arxiv.2402.11794,
title = {Unveiling the Magic: Investigating Attention Distillation in Retrieval-augmented Generation},
author = {Zizhong Li and Haopeng Zhang and Jiawei Zhang},
journal= {arXiv preprint arXiv:2402.11794},
year = {2024}
}
备注
10 pages, 8 figures