中文

利用多任务神经网络对社交媒体噪声建模以识别命名实体

计算与语言 2019-06-11 v1

摘要

在文档中识别命名实体是许多 NLP 应用中的一项关键任务。尽管当前针对该任务的最先进方法在干净文本(例如新闻通讯体裁)上达到了很高的性能,但当这些算法转移到社交媒体领域等噪声环境时,性能会急剧下降。我们提出两个系统,利用字符级语音与音系、词嵌入以及词性标签作为特征来处理社交媒体数据的挑战。第一个模型是一个多任务端到端双向长短期记忆(BLSTM)-条件随机场(CRF)网络,其输出层包含两个 CRF 分类器。第二个模型使用一个多任务 BLSTM 网络作为特征提取器,将学习迁移到一个 CRF 分类器以进行最终预测。我们的系统在 Workshop on Noisy User-generated Text 2017 数据集上分别以超出当前最先进 F1 分数 2.45% 和 3.69% 的表现,确立了更适用于社交媒体环境的方法。

关键词

引用

@article{arxiv.1906.04129,
  title  = {Modeling Noisiness to Recognize Named Entities using Multitask Neural Networks on Social Media},
  author = {Gustavo Aguilar and A. Pastor López-Monroy and Fabio A. González and Thamar Solorio},
  journal= {arXiv preprint arXiv:1906.04129},
  year   = {2019}
}

备注

NAACL 2018