中文

BURT:基于孪生结构的BERT启发式通用表示

计算与语言 2020-08-04 v2

摘要

诸如BERT等预训练上下文语言模型在广泛的下游自然语言处理(NLP)任务中展现出极佳效果。然而,这些模型提供的有效表示针对序列内每个词元而非每个序列,且微调步骤需同时输入两个序列,导致对不同粒度的各类序列表示不尽如人意。尤其在这些模型中作为完整训练上下文的句子级表示,在较低层级语言单元(短语和词)上表现欠佳。本工作中,我们提出BURT(BERT启发的孪生结构通用表示),能够利用大规模自然语言推理和复述数据及多重训练目标,为任意粒度的输入序列(即词、短语和句子)生成通用定长表示。我们提出的BURT采用孪生网络,分别从自然语言推理数据集学习句子级表示、从复述数据集学习词/短语级表示。我们在不同粒度的文本相似度任务上评估BURT,包括STS任务、SemEval2013 Task 5(a)及一些常用词相似度任务,BURT在句子级数据集上大幅优于其他表示模型,并在词/短语级表示上取得显著改进。

关键词

引用

@article{arxiv.2004.13947,
  title  = {BURT: BERT-inspired Universal Representation from Twin Structure},
  author = {Yian Li and Hai Zhao},
  journal= {arXiv preprint arXiv:2004.13947},
  year   = {2020}
}