中文

社交媒体中从原始文本到端到端的命名实体识别

计算与语言 2019-08-16 v1 机器学习

摘要

典型的命名实体识别(NER)模型以词序列作为输入,忽略了来自预处理(例如分词)的错误。然而,这些错误会极大地影响模型性能,尤其是对于像推文这样的噪声文本。在此,我们提出 Neural-Char-CRF,一种对预处理错误更具鲁棒性的从原始到端(raw-to-end)框架。它以原始字符序列作为输入并进行端到端预测。词嵌入和上下文表示模型被进一步调整,以捕捉每个字符而非每个词的文本信号。我们的模型既不需要将字符序列转换为词序列,也不假设分词器能正确检测所有词边界。此外,我们观察到在将分词替换为字符串匹配后,模型性能保持不变,这证明了其具备无分词(tokenization-free)的潜力。在两个公开数据集上的大量实验结果证明了我们所提方法优于当前最优(state of the art)方法。实现代码与数据集已发布于:https://github.com/LiyuanLucasLiu/Raw-to-End。

关键词

引用

@article{arxiv.1908.05344,
  title  = {Raw-to-End Name Entity Recognition in Social Media},
  author = {Liyuan Liu and Zihan Wang and Jingbo Shang and Dandong Yin and Heng Ji and Xiang Ren and Shaowen Wang and Jiawei Han},
  journal= {arXiv preprint arXiv:1908.05344},
  year   = {2019}
}