中文

用于段落检索的集体相关性标注

信息检索 2022-05-10 v2 人工智能 计算与语言

摘要

信息检索(IR)中的深度学习需要大量高质量的查询-文档相关性标注,但此类标注本质上稀疏。标签平滑将部分观测到的概率质量重新分配给未观测实例,通常是均匀地、在不知真实分布的情况下进行。相比之下,我们提出用于知情标注的知识蒸馏,且在评估时不带来高计算开销。我们的贡献是设计了一个简单但高效、利用集体知识的教师模型,以优于从更复杂教师模型蒸馏出的当前最优方法。具体而言,我们比当前最优教师模型训练快至多 8 倍,同时更好地蒸馏排序。我们的代码公开于 https://github.com/jihyukkim-nlp/CollectiveKD。

关键词

引用

@article{arxiv.2205.03273,
  title  = {Collective Relevance Labeling for Passage Retrieval},
  author = {Jihyuk Kim and Minsoo Kim and Seung-won Hwang},
  journal= {arXiv preprint arXiv:2205.03273},
  year   = {2022}
}

备注

NAACL 2022