中文

基于循环神经网络的混合社交媒体文本词性标注器

计算与语言 2016-11-17 v2

摘要

本文描述了高级计算发展中心(CDACM)提交至共享任务——“混合印度社交媒体(Facebook、Twitter 和 Whatsapp)文本词性标注工具竞赛”的系统,该竞赛与 ICON-2016 同期举行。该共享任务旨在对给定文本进行词级别的词性(POS)标注预测。混合文本主要由多语言用户在社交媒体上生成。多语言词汇、音译和拼写变体的存在使得此类内容在语言学上十分复杂。在本文中,我们提出了一种使用循环神经网络语言模型(RNN-LM)架构对混合社交媒体文本进行 POS 标注的方法。我们提交了印地语-英语、孟加拉语-英语和泰卢固语-英语混合数据的结果。

关键词

引用

@article{arxiv.1611.04989,
  title  = {Recurrent Neural Network based Part-of-Speech Tagger for Code-Mixed Social Media Text},
  author = {Raj Nath Patel and Prakash B. Pimpale and M Sasikumar},
  journal= {arXiv preprint arXiv:1611.04989},
  year   = {2016}
}

备注

7 pages, Published at the Tool Contest on POS tagging for Indian Social Media Text, ICON 2016