中文

以BiDAF为例架构考察深度网络在NLP中的有效性

计算与语言 2021-09-02 v1 机器学习

摘要

基于NLP的问答已通过BERT、BiDAF等先进模型架构以及早期的词、字符和基于上下文的嵌入的演进而取得进展。由于BERT已大幅超越各类模型的精度,下一前沿的一个要素可以是引入深度网络及其有效训练方式。在此背景下,我以BiDAF的模型编码器层为重点探讨了深度网络的有效性。BiDAF以其异构层不仅提供了探索深度网络有效性的机会,也提供了评估在较低层所做的改进是否对模型架构上层的改进具有叠加性的机会。我认为NLP中下一个最优秀的模型实际上会将类似BERT的扎实语言建模与复合架构相结合,从而在通用语言建模之外带来改进,并具备更宽泛的分层架构。我试验了Bypass网络、残差高速网络与DenseNet架构。此外,我评估了将网络最后几层集成起来的有效性。我还研究了字符嵌入加入词嵌入所带来的差异,以及其效果是否与深度网络具有叠加性。我的研究表明,深度网络确实能有效带来提升。同时,像嵌入这样的较低层中的改进会叠加地传递到通过深度网络所获得的增益上。

关键词

引用

@article{arxiv.2109.00074,
  title  = {Effectiveness of Deep Networks in NLP using BiDAF as an example architecture},
  author = {Soumyendu Sarkar},
  journal= {arXiv preprint arXiv:2109.00074},
  year   = {2021}
}