中文

Poly-encoder:用于快速准确多句评分的 Transformer 架构与预训练策略

计算与语言 2020-03-27 v4 人工智能

摘要

深度预训练双向 transformer 的使用已在若干应用中带来显著进展(Devlin 等,2018)。对于在序列间进行成对比较、将给定输入与相应标签匹配的任务,两种常见方法是:对 pair 执行完整自注意的 Cross-encoder,以及分别编码 pair 的 Bi-encoder。前者通常表现更好,但速度太慢而无法实际使用。在本工作中,我们开发了一种新的 transformer 架构,即 Poly-encoder,它学习全局而非 token 级别的自注意特征。我们对这三种方法进行了详细比较,包括何种预训练和微调策略效果最佳。我们展示了我们的模型在三个现有任务上取得了 SOTA 结果;Poly-encoder 比 Cross-encoder 更快且比 Bi-encoder 更准确;并且最佳结果是通过在与下游任务相似的大规模数据集上预训练获得的。

关键词

引用

@article{arxiv.1905.01969,
  title  = {Poly-encoders: Transformer Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence Scoring},
  author = {Samuel Humeau and Kurt Shuster and Marie-Anne Lachaux and Jason Weston},
  journal= {arXiv preprint arXiv:1905.01969},
  year   = {2020}
}

备注

ICLR 2020