基于孪生 BERT 的网页搜索相关性排序模型及其在捷克语新数据集上的评估
信息检索
2021-12-06 v1 计算与语言
摘要
网页搜索引擎致力于在数百毫秒内提供高度相关的结果。因此,由于计算需求高,诸如 BERT 之类的预训练语言 transformer 模型很难用于该场景。我们提出了一种针对文档排序问题的实时方法,利用基于 BERT 的孪生架构。该模型已部署于商业搜索引擎中,并将生产性能提升了 3% 以上。为了进一步研究与评估,我们发布了 DaReCzech,这是一个包含 160 万条带人工标注相关性等级的捷克语用户查询-文档对的独特数据集。我们还发布了 Small-E-Czech,一个在大型捷克语语料上预训练的 Electra-small 语言模型。我们相信该数据将支持搜索相关性与多语言聚焦研究团体的努力。
引用
@article{arxiv.2112.01810,
title = {Siamese BERT-based Model for Web Search Relevance Ranking Evaluated on a New Czech Dataset},
author = {Matěj Kocián and Jakub Náplava and Daniel Štancl and Vladimír Kadlec},
journal= {arXiv preprint arXiv:2112.01810},
year = {2021}
}
备注
Accepted at the Thirty-Fourth Annual Conference on Innovative Applications of Artificial Intelligence (IAAI-22). IAAI Innovative Application Award. 9 pages, 3 figures, 8 tables