中文

IR-BERT:利用 BERT 进行新闻文章背景链接中的语义搜索

信息检索 2020-07-27 v1 计算与语言

摘要

本文描述了我们在 TREC 2020 新闻赛道背景链接任务中的两种方法。该任务的主要目标是推荐一份相关文章列表,读者应参考这些文章以理解查询文章的上下文并获得背景信息。我们的第一种方法侧重于通过组合从查询文档中提取的加权关键词来构建有效的搜索查询,并使用 BM25 进行检索。第二种方法利用 SBERT (Nils Reimers 等人) 学习查询上下文表示的能力,以在语料库上执行语义搜索。我们通过实验证明,采用语言模型有助于我们理解查询文章的上下文和背景。所提出的方法在 TREC 2018 华盛顿邮报数据集上进行了评估,我们最好的模型在 nDCG@5 指标上优于 TREC 中位数以及 2018 年得分最高的模型。我们进一步提出了一种多样性度量,以评估各种方法在检索多样化文档集方面的有效性。这可能会激励研究人员在其推荐列表中引入多样性。我们已在 Github 上开源了我们的实现,并计划提交我们的运行结果参加 TREC 2020 的背景链接任务。

关键词

引用

@article{arxiv.2007.12603,
  title  = {IR-BERT: Leveraging BERT for Semantic Search in Background Linking for News Articles},
  author = {Anup Anand Deshmukh and Udhav Sethi},
  journal= {arXiv preprint arXiv:2007.12603},
  year   = {2020}
}

备注

6 pages, 6 figures