中文

基于查询导向稀疏 Transformer 的长文档排序

人工智能 2020-10-27 v1 计算与语言

摘要

在文档排序任务中,Transformer 自注意力的计算代价常常需要将长文档切分以适配预训练模型。本文设计了一种查询导向稀疏注意力(Query-Directed Sparse attention),在 Transformer 自注意力中引入信息检索(IR)公理结构。我们的模型 QDS-Transformer 强制实现了排序中所期望的核心性质:局部上下文建模、层次化表示以及查询导向的邻近匹配,同时得益于稀疏性而具备高效性。在 one fully supervised 和三个 few-shot TREC 文档排序基准上的实验表明,QDS-Transformer 相比以往方法具有一致且稳健的优势,后者要么将长文档改造后输入 BERT,要么使用稀疏注意力却未强调 IR 原则。我们进一步量化了计算复杂度,并证明采用 TVM 实现的稀疏注意力比全连接自注意力高效一倍。本工作的所有源代码、训练模型和预测结果均可在 https://github.com/hallogameboy/QDS-Transformer 获取。

关键词

引用

@article{arxiv.2010.12683,
  title  = {Long Document Ranking with Query-Directed Sparse Transformer},
  author = {Jyun-Yu Jiang and Chenyan Xiong and Chia-Jung Lee and Wei Wang},
  journal= {arXiv preprint arXiv:2010.12683},
  year   = {2020}
}

备注

Accepted by EMNLP 2020, 12 pages, 5 figures