中文

ICON 2015 混合代码印度社交媒体文本的词性标注

计算与语言 2016-01-07 v1

摘要

本文讨论了我们在贾达夫普尔大学(Jadavpur University)作为参与 ICON 2015 任务“混合代码印度社交媒体文本的词性标注”所进行的实验。我们为该任务开发的工具基于三元隐马尔可夫模型(Trigram Hidden Markov Model),利用来自词典的信息以及一些其他词级特征,以增强已知词符和未知词符的观测概率。我们提交了孟加拉语-英语、印地语-英语和泰米尔语-英语语言对的运行结果。我们的系统已在 ICON 2015 共享任务“混合代码印度社交媒体文本的词性标注”发布的数据集上进行了训练和测试。在受限模式下,我们的系统获得平均总体准确率(对所有三种语言对取平均)75.60%,非常接近排名高于我们的另外两个参与系统(IIITH 为 76.79%,AMRITA_CEN 为 75.79%)。在非受限模式下,我们的系统获得平均总体准确率 70.65%,也接近获得最高平均总体准确率的系统(AMRITA_CEN 为 72.85%)。

关键词

引用

@article{arxiv.1601.01195,
  title  = {Part-of-Speech Tagging for Code-mixed Indian Social Media Text at ICON 2015},
  author = {Kamal Sarkar},
  journal= {arXiv preprint arXiv:1601.01195},
  year   = {2016}
}

备注

NLP Tool Contest on "POS Tagging For Code-mixed Indian Social Media Text" held in conjunction with International Conference on Natural Language Processing(ICON 2015). arXiv admin note: text overlap with arXiv:1512.03950, arXiv:1405.7397