中文

利用全局上下文嵌入提升面向特定 Twitter 流的实体提及检测

计算与语言 2022-01-31 v1

摘要

诸如 Twitter 之类的微博客网站已成为普遍的信息来源。与微博客中信息自动抽取和分析相关的两项重要任务是实体提及检测(EMD)与实体检测(ED)。最先进的 EMD 系统旨在通过基于离线静态数据集训练来建模微博客文本的非文学性。它们从单条消息中提取表面层特征——正字法、词汇和语义——以进行噪声文本建模与实体抽取。但鉴于微博客流不断演化的性质,从短消息这种多变却有限的上下文中检测所有实体提及仍是一个难题。为此,我们提出一个名为 EMD Globalizer 的框架,更适用于在微博客流上执行 EMD 学习器。它偏离了现有 EMD 系统对孤立微博客消息的处理方式,后者利用从消息即时上下文中习得的知识来建议实体。在由某 EMD 系统完成实体候选的初步抽取后,所提框架利用出现度挖掘来发现此次初次检测中遗漏的额外候选提及。聚合这些提及的局部上下文表示,从流内某实体候选的集体上下文中得出一个全局嵌入。该全局嵌入随后被用于从候选中区分实体与假阳性。所述实体的所有提及均由框架的最终输出给出。我们的实验表明,EMD Globalizer 能以较小的额外计算开销提升我们所测试的所有现有 EMD 系统的有效性(平均提升 25.61%)。

关键词

引用

@article{arxiv.2201.11885,
  title  = {Boosting Entity Mention Detection for Targetted Twitter Streams with Global Contextual Embeddings},
  author = {Satadisha Saha Bhowmick and Eduard C. Dragut and Weiyi Meng},
  journal= {arXiv preprint arXiv:2201.11885},
  year   = {2022}
}