利用多任务神经网络对社交媒体噪声建模以识别命名实体
计算与语言
2019-06-11 v1
摘要
在文档中识别命名实体是许多 NLP 应用中的一项关键任务。尽管当前针对该任务的最先进方法在干净文本(例如新闻通讯体裁)上达到了很高的性能,但当这些算法转移到社交媒体领域等噪声环境时,性能会急剧下降。我们提出两个系统,利用字符级语音与音系、词嵌入以及词性标签作为特征来处理社交媒体数据的挑战。第一个模型是一个多任务端到端双向长短期记忆(BLSTM)-条件随机场(CRF)网络,其输出层包含两个 CRF 分类器。第二个模型使用一个多任务 BLSTM 网络作为特征提取器,将学习迁移到一个 CRF 分类器以进行最终预测。我们的系统在 Workshop on Noisy User-generated Text 2017 数据集上分别以超出当前最先进 F1 分数 2.45% 和 3.69% 的表现,确立了更适用于社交媒体环境的方法。
引用
@article{arxiv.1906.04129,
title = {Modeling Noisiness to Recognize Named Entities using Multitask Neural Networks on Social Media},
author = {Gustavo Aguilar and A. Pastor López-Monroy and Fabio A. González and Thamar Solorio},
journal= {arXiv preprint arXiv:1906.04129},
year = {2019}
}
备注
NAACL 2018