中文

通过义原提升循环神经网络的序列建模能力

计算与语言 2020-08-20 v2 机器学习 音频与语音处理

摘要

义原作为人类语言的最小语义单位,已成功应用于多种自然语言处理任务。然而,现有研究多在特定任务中利用义原,少有更基础性地使用义原的尝试。本文提出将义原融入循环神经网络(RNNs)以提升其序列建模能力,这有益于各类下游任务。我们设计了三种不同的义原融入方法,并将其应用于典型RNN(包括LSTM、GRU及其双向变体)。在评测中,我们使用涉及PTB和WikiText-2的若干基准数据集进行语言建模,使用SNLI进行自然语言推理,以及另外两个用于情感分析和释义检测的数据集。实验结果表明,相较于原始RNN,融入义原的模型取得显著且一致的提升,证明了义原融入方法的有效性。此外,我们发现融入义原的模型具有更高鲁棒性,并在防御对抗攻击上优于对抗训练。本工作的所有代码与数据可在 https://github.com/thunlp/SememeRNN 获取。

关键词

引用

@article{arxiv.1910.08910,
  title  = {Improving Sequence Modeling Ability of Recurrent Neural Networks via Sememes},
  author = {Yujia Qin and Fanchao Qi and Sicong Ouyang and Zhiyuan Liu and Cheng Yang and Yasheng Wang and Qun Liu and Maosong Sun},
  journal= {arXiv preprint arXiv:1910.08910},
  year   = {2020}
}

备注

Published in IEEE/ACM Transactions on Audio, Speech, and Language Processing (TASLP). 10 pages, 2 figures