中文

Stacked DeBERT:面向不完整数据文本分类的全注意力模型

计算与语言 2021-01-15 v2 机器学习

摘要

本文提出Stacked DeBERT,全称Stacked Denoising Bidirectional Encoder Representations from Transformers(堆叠去噪双向Transformer编码器表示)。该新颖模型通过在BERT(一种仅基于注意力机制的强大语言表示模型)中设计新型编码方案,相较于现有系统提升了在不完整数据下的鲁棒性。自然语言处理中的不完整数据指含有缺失或错误词语的文本,此类数据的存在会阻碍当前未针对此类噪声设计但仍须在压力下保持良好表现的模型性能。这是因为当前方法针对干净且完整的数据构建与训练,因而无法提取能充分表示不完整数据的特征。我们提出的方法先对输入词元应用嵌入层再由原始transformer处理以获得中间输入表示,这些中间特征作为新型去噪transformer的输入以得到更丰富的输入表示。该方法利用多层感知机栈通过提取更抽象且有意义的隐藏特征向量来重建缺失词语的嵌入,并利用双向transformer改进嵌入表示。我们采用两个数据集进行训练与评估:Chatbot自然语言理解评估语料库与Kaggle的Twitter情感语料库。在情感与意图分类任务中,我们的模型在推文里的非正式/错误文本以及含语音转文本错误的文本上表现出更高的F1分数与更好的鲁棒性。

关键词

引用

@article{arxiv.2001.00137,
  title  = {Stacked DeBERT: All Attention in Incomplete Data for Text Classification},
  author = {Gwenaelle Cunha Sergio and Minho Lee},
  journal= {arXiv preprint arXiv:2001.00137},
  year   = {2021}
}

备注

Published (https://doi.org/10.1016/j.neunet.2020.12.018), Code (https://github.com/gcunhase/StackedDeBERT)