语义标注任务在关联数据云上的分析
计算机科学中的逻辑
2018-11-22 v2 形式语言与自动机理论
摘要
语义标注,即在文本中识别关键短语并将其链接到知识库中的概念,是语义信息检索和语义网普及的重要基础。尽管出现了诸多语义标注系统,关于其性能的对比研究却极少发表。本文对现有系统在三项任务上的性能进行评估:完整语义标注、命名实体识别和关键词检测。更具体地,对所有三项任务评估其 spotting 能力(识别文本中相关表层形式),而消歧(将维基百科或DBpedia中的正确实体关联到所识别表层形式)仅对前两项任务评估。我们的评估有两方面:首先,我们在多样化数据集上计算语义标注器输出的标准精确率与召回率,各数据集最适于所识别任务之一;其次,我们使用逻辑回归建立统计模型以识别显著的性能差异。结果表明,提供完整标注的系统在所有三项任务上均优于命名实体标注器和关键词抽取器。然而,对于识别文本中描述的最相关实体,仍有很大改进空间。
引用
@article{arxiv.1811.05548,
title = {Measuring Masking Fault-Tolerance},
author = {Pablo F. Castro and Pedro R. D'Argenio and Ramiro Demasi and Luciano Putruele},
journal= {arXiv preprint arXiv:1811.05548},
year = {2018}
}
备注
25 pages including an appendix