用于段落检索的集体相关性标注
信息检索
2022-05-10 v2 人工智能
计算与语言
摘要
信息检索(IR)中的深度学习需要大量高质量的查询-文档相关性标注,但此类标注本质上稀疏。标签平滑将部分观测到的概率质量重新分配给未观测实例,通常是均匀地、在不知真实分布的情况下进行。相比之下,我们提出用于知情标注的知识蒸馏,且在评估时不带来高计算开销。我们的贡献是设计了一个简单但高效、利用集体知识的教师模型,以优于从更复杂教师模型蒸馏出的当前最优方法。具体而言,我们比当前最优教师模型训练快至多 8 倍,同时更好地蒸馏排序。我们的代码公开于 https://github.com/jihyukkim-nlp/CollectiveKD。
引用
@article{arxiv.2205.03273,
title = {Collective Relevance Labeling for Passage Retrieval},
author = {Jihyuk Kim and Minsoo Kim and Seung-won Hwang},
journal= {arXiv preprint arXiv:2205.03273},
year = {2022}
}
备注
NAACL 2022