中文

阿萨姆语及其他印度语言命名实体识别综述

计算与语言 2014-07-11 v1

摘要

命名实体识别在处理信息抽取、问答、机器翻译、文档摘要等主要自然语言处理任务时始终至关重要,因此本文提出了一份关于印度语言命名实体的综述,特别侧重于阿萨姆语。目前存在多种基于规则和机器学习的命名实体识别方法。文章首先介绍了可用的命名实体识别方法,随后讨论了该领域的相关研究。阿萨姆语与其他印度语言一样属于黏着语,且面临资源匮乏的问题,因为命名实体识别需要大规模数据集、地名词典列表、词典等,而英语中常见的大写等有用特征在阿萨姆语中并不存在。除此之外,我们还描述了在阿萨姆语中进行命名实体识别时所面临的一些问题。

关键词

引用

@article{arxiv.1407.2918,
  title  = {A Survey of Named Entity Recognition in Assamese and other Indian Languages},
  author = {Gitimoni Talukdar and Pranjal Protim Borah and Arup Baruah},
  journal= {arXiv preprint arXiv:1407.2918},
  year   = {2014}
}

备注

ICONACC-2014