PROD:面向稠密检索的渐进式蒸馏
信息检索
2023-06-27 v3 计算与语言
摘要
知识蒸馏是将强教师模型的知识迁移到高效学生模型的有效方法。理想情况下,我们期望教师模型越好,学生模型越好。然而,这一期望并非总能得到实现。由于教师与学生之间不可忽略的差距,更好的教师模型通过蒸馏得到更差学生模型的情况十分常见。为弥合这一差距,我们提出PROD,一种用于稠密检索的渐进式蒸馏(PROgressive Distillation)方法。PROD由教师渐进式蒸馏和数据渐进式蒸馏组成,以逐步提升学生模型。我们在五个广泛使用的基准——MS MARCO Passage、TREC Passage 19、TREC Document 19、MS MARCO Document和Natural Questions上进行了大量实验,其中PROD在稠密检索的蒸馏方法中达到了最先进水平(SOTA)。代码与模型将公开发布。
引用
@article{arxiv.2209.13335,
title = {PROD: Progressive Distillation for Dense Retrieval},
author = {Zhenghao Lin and Yeyun Gong and Xiao Liu and Hang Zhang and Chen Lin and Anlei Dong and Jian Jiao and Jingwen Lu and Daxin Jiang and Rangan Majumder and Nan Duan},
journal= {arXiv preprint arXiv:2209.13335},
year = {2023}
}
备注
Accepted by WWW2023