中文

探索合成查询生成在相关性预测中的可行性

信息检索 2023-06-21 v2 计算与语言

摘要

查询-文档相关性预测是信息检索系统中的一个关键问题。该问题日益通过(预训练的)基于transformer的模型来解决,这些模型使用大量标注数据微调。然而,在电子商务和医疗等专门领域,由于缺乏大规模领域内数据,该方法的可行性受限。为解决这一匮乏,近期方法利用这些强大模型生成高质量任务和领域特定的合成数据。先前工作主要探索了用于问答(QA)和二元(是/否)相关性预测的合成数据生成或查询生成(QGen),例如,QGen模型被给定一篇文档,并训练生成与该文档相关的查询。但在许多问题中,我们对相关性的概念比简单的是/否标签更细粒度。因此,在本工作中,我们详细研究了如何利用QGen方法实现细致的相关性预测。我们证明——与先前工作的断言相反——当前的QGen方法不及更传统的跨域迁移学习方法。通过跨越3个公共电子商务基准的实证研究,我们识别出已有QGen方法的新缺陷——包括其无法区分不同等级的相关性。为此,我们引入了标签条件化QGen模型,该模型融入了关于不同相关性的知识。尽管我们的实验表明这些修改有助于提升QGen技术的性能,我们也发现QGen方法难以捕捉相关性标签空间的完整细微差别,因此生成的查询并不忠实于期望的相关性标签。

关键词

引用

@article{arxiv.2305.11944,
  title  = {Exploring the Viability of Synthetic Query Generation for Relevance Prediction},
  author = {Aditi Chaudhary and Karthik Raman and Krishna Srinivasan and Kazuma Hashimoto and Mike Bendersky and Marc Najork},
  journal= {arXiv preprint arXiv:2305.11944},
  year   = {2023}
}

备注

In Proceedings of ACM SIGIRWorkshop on eCommerce (SIGIR eCom 23)