BERTQA——增强注意力机制
计算与语言
2019-12-24 v1 机器学习
摘要
在这项工作中,我们扩展双向 Transformer 编码器表示(BERT),着重于有向共同注意力,以在 SQUAD2.0 数据集上获得改进的 F1 性能。BERT 所基于的 Transformer 架构对上下文与查询的拼接施加分层全局注意力。我们对 BERT 架构的增补通过一组改进的 Transformer 编码器单元,以更聚焦的上下文到查询(C2Q)和查询到上下文(Q2C)注意力增强该注意力。此外,我们探索在共同注意力架构内添加基于卷积的特征提取,以将局部信息加入自注意力。我们发现共同注意力在 base 架构中将无答案 F1 显著提升 4 个点,在 large 架构中提升 1 个点。添加跳跃连接后无答案 F1 进一步提升,且未造成有答案 F1 的额外损失。局部特征提取加入注意力使 base 架构的总体 dev F1 达到 77.03。我们将发现应用于包含两倍层数 large BERT 模型,并进一步使用了我们通过回译创建的增强版 SQUAD 2.0 数据集,命名为 SQUAD 2.Q。最后,我们进行超参数调优并集成我们的最佳模型,获得最终 F1/EM 为 82.317/79.442(Attention on Steroids,PCE Test Leaderboard)。
引用
@article{arxiv.1912.10435,
title = {BERTQA -- Attention on Steroids},
author = {Ankit Chadha and Rewa Sood},
journal= {arXiv preprint arXiv:1912.10435},
year = {2019}
}