中文

一种用于问题检索的判别性语义排序器

信息检索 2021-07-20 v1

摘要

相似问题检索是基于社区的问答(CQA)服务中的核心任务。为兼顾效果与效率,问题检索系统通常实现为多阶段排序器:第一阶段排序器旨在从大规模库中召回潜在相关问题,后续阶段尝试对检索结果重新排序。现有关于问题检索的工作主要聚焦于重排序阶段,而将第一阶段排序器留给一些传统的基于词项的方法。然而,基于词项的方法常受词汇不匹配问题困扰,尤其在短文本上,这可能从一开始就阻碍重排序器获取相关问题。一种替代方案是采用基于嵌入的方法作为第一阶段排序器,其将文本压缩为稠密向量以增强语义匹配。但这些方法常丢失基于词项方法的判别能力,从而在检索中引入噪声并损害召回性能。在本工作中,我们旨在解决第一阶段排序器的两难困境,并提出一种判别性语义排序器,即 DenseTrans,用于高召回检索。具体而言,DenseTrans 是一个稠密连接的 Transformer,基于 Transformer 层学习文本的语义嵌入。同时,DenseTrans 通过稠密连接提升低层特征,以保持所学表示的判别能力。DenseTrans 受计算机视觉(CV)中 DenseNet 的启发,但提出了一种与其原始设计目的完全不同的稠密连接使用方式。在两个问题检索基准数据集上的实验结果表明,我们的模型相比强基线基于词项的方法以及最先进的基于嵌入的方法,在召回上均取得显著提升。

关键词

引用

@article{arxiv.2107.08345,
  title  = {A Discriminative Semantic Ranker for Question Retrieval},
  author = {Yinqiong Cai and Yixing Fan and Jiafeng Guo and Ruqing Zhang and Yanyan Lan and Xueqi Cheng},
  journal= {arXiv preprint arXiv:2107.08345},
  year   = {2021}
}

备注

ICTIR'21