利用先验知识引导 BERT 在语义文本匹配任务中的注意力
计算与语言
2021-02-23 v1 人工智能
摘要
我们研究将先验知识融入基于深度 Transformer 的模型,即双向编码器表示来自 Transformer(BERT),以提升其在语义文本匹配任务上的性能。通过探查与分析 BERT 在解决该任务时已掌握的内容,我们更好地理解了 BERT 最需要的任务特定知识以及最需要这些知识的位置。该分析进一步促使我们采取与多数现有工作不同的方法。我们不是使用先验知识为微调 BERT 创建新的训练任务,而是将知识直接注入 BERT 的多头注意力机制。这引出了一种简单而有效的方法,由于省去了在主任务之外额外数据或任务上的训练,其训练阶段快捷。大量实验表明,所提出的知识增强 BERT 能够持续优于原始 BERT 模型的语义文本匹配性能,且在训练数据稀缺时性能增益最为显著。
引用
@article{arxiv.2102.10934,
title = {Using Prior Knowledge to Guide BERT's Attention in Semantic Textual Matching Tasks},
author = {Tingyu Xia and Yue Wang and Yuan Tian and Yi Chang},
journal= {arXiv preprint arXiv:2102.10934},
year = {2021}
}
备注
10 pages, WWW'21, April19-23, 2021, Ljubljana, Slovenia