基于隐马尔可夫模型的FIRE 2015社交媒体英文文本实体抽取系统
计算与语言
2015-12-15 v1
摘要
本文介绍了我们在贾达普尔大学(Jadavpur University)参与FIRE 2015任务:社交媒体文本实体抽取-印度语言(ESM-IL)所进行的实验。我们为该任务开发的工具基于三元隐马尔可夫模型(Trigram Hidden Markov Model),利用地名词典列表、词性标注(POS tag)和其他词级特征来增强已知和未知词元的观测概率。我们仅提交了英语语种的结果。采用统计HMM(隐马尔可夫模型)基模型实现系统。系统在FIRE 2015任务发布的数据集上训练与测试:社交媒体文本实体抽取-印度语言(ESM-IL)。我们的系统在英语语种上表现最佳,精确率、召回率和F值分别为61.96、39.46和48.21。
引用
@article{arxiv.1512.03950,
title = {A Hidden Markov Model Based System for Entity Extraction from Social Media English Text at FIRE 2015},
author = {Kamal Sarkar},
journal= {arXiv preprint arXiv:1512.03950},
year = {2015}
}
备注
FIRE 2015 Task:Entity Extraction from Social Media Text - Indian Languages (ESM-IL) - See more at: http://fire.irsi.res.in/fire/home#sthash.HpgiwjP5.dpuf. arXiv admin note: substantial text overlap with arXiv:1405.7397