面向混合代码印度社交媒体文本的词性标注器——Surukam 的 ICON-2016 NLP 工具竞赛参赛作品
计算与语言
2017-01-03 v1
摘要
为混合代码的印度语言构建词性 (POS) 标注器是计算语言学中一个极具挑战性的问题,因为缺乏准确标注的训练语料库。ICON 作为其 NLP 工具竞赛的一部分,连续第二年将该挑战组织为共享任务,以推动现有技术水平的提升。本文描述了在 Surukam 构建的 POS 标注器,用于预测三个语言对——孟加拉语-英语、泰卢固语-英语和印地语-英语的粗粒度和细粒度 POS 标签,文本涵盖三个流行的社交媒体平台——Facebook、WhatsApp 和 Twitter。我们采用条件随机场作为序列标注算法,并使用名为 sklearn-crfsuite 的库——一个围绕 CRFsuite 的轻量级封装——来训练我们的模型。我们使用的特征包括字符 n-gram、语言信息以及表情符号、数字、标点符号和网址的模式。我们在受限环境下的提交,即未使用任何单语 POS 标注器或类似工具,获得了 76.45% 的总体平均 F1 分数,与 2015 年 76.79% 的获胜分数相当。
引用
@article{arxiv.1701.00066,
title = {A POS Tagger for Code Mixed Indian Social Media Text - ICON-2016 NLP Tools Contest Entry from Surukam},
author = {Sree Harsha Ramesh and Raveena R Kumar},
journal= {arXiv preprint arXiv:1701.00066},
year = {2017}
}
备注
4 Pages, 13th International Conference on Natural Language Processing, Varanasi, India