SMPOST:面向代码混合印度社交媒体文本的词性标注器
计算与语言
2017-02-03 v2
摘要
近年来社交媒体的使用急剧增长。用户在通过社交媒体交流时遵循非正式语言。交流语言常具有混合性质,人们用英语转写其地区语言,且该技术极为流行。自然语言处理(NLP)旨在从这些文本中推断信息,其中词性(PoS)标注在获取书面文本韵律方面发挥着重要作用。针对代码混合印度社交媒体文本的词性标注任务,我们开发了基于条件随机场分类器的监督系统。为有效应对该问题,我们着重提取丰富的语言特征。我们参与了三种不同语言对,即英语- Hindi、英语- Bengali 和英语- Telugu,在三种不同社交媒体平台 Twitter、Facebook 与 WhatsApp 上。所提系统能够为给定的代码混合句子成功分配粗粒度及细粒度 PoS 标签。实验表明,我们的系统具有相当的通用性,在所有三个语言对的所有领域均展现出令人鼓舞的性能水平。
引用
@article{arxiv.1702.00167,
title = {SMPOST: Parts of Speech Tagger for Code-Mixed Indic Social Media Text},
author = {Deepak Gupta and Shubham Tripathi and Asif Ekbal and Pushpak Bhattacharyya},
journal= {arXiv preprint arXiv:1702.00167},
year = {2017}
}
备注
5 pages, ICON 2016