改进土耳其语推文命名实体识别的实验
计算与语言
2014-11-03 v1
摘要
社交媒体文本是趋势分析、事件监测和意见挖掘等多个应用领域的重要信息来源。遗憾的是,现有的针对命名实体识别等任务的解决方案在正式文本上表现良好,但应用于社交媒体文本时通常表现不佳。在本文中,我们报告了旨在使用两个不同的标注数据集来改进土耳其语推文命名实体识别的实验。在这些实验中,以一个基线命名实体识别系统为起点,我们通过放宽其大写约束和基于变音符号的词法资源扩展,将其识别规则和资源进行调整以更好地适应 Twitter 语言;并且我们对推文采用了简化的规范化方案,以观察这些调整对土耳其语推文整体命名实体识别性能的影响。本文提供了系统在这些不同设置下的评估结果,并对这些结果进行了讨论。
引用
@article{arxiv.1410.8668,
title = {Experiments to Improve Named Entity Recognition on Turkish Tweets},
author = {Dilek Küçük and Ralf Steinberger},
journal= {arXiv preprint arXiv:1410.8668},
year = {2014}
}
备注
appears in Proceedings of the EACL Workshop on Language Analysis for Social Media, 2014