X 类型——Twitter 空间语义映射
计算与语言
2024-09-24 v1
摘要
社交网络构成了世界知识的宝贵来源,其中具有影响力的实体对应于受欢迎的账户。与维护语义本体的基于事实的知识库(KB)不同,社交媒体上无法获得结构化的语义信息。在这项工作中,我们考虑了一个包含大约 20 万个受欢迎的 Twitter 账户的社交知识库,用于表示感兴趣的实体。我们提取关于这些实体的语义信息。具体而言,我们将它们与一组细粒度的 136 种语义类型相关联,例如,确定给定的实体账户是属于政治家还是音乐艺术家。由于 Twitter 中缺乏显式的类型信息,我们通过与 DBpedia 和 Wikidata 的知识库对齐,获得了部分账户的语义标签。给定带标签的数据集,我们微调了一个基于 Transformer 的文本编码器,以根据账户内容生成实体的语义嵌入。然后,我们利用这一证据以及基于网络的嵌入来预测实体的语义类型。在我们的实验中,我们展示了在带标签数据集上很高的类型预测性能。因此,我们将我们的类型分类模型应用于社交知识库中的所有实体账户。我们对结果的分析提供了关于 Twitter 空间全局语义的见解。我们讨论了应该受益于语义类型信息和本工作中生成的社交实体语义嵌入的下游应用。具体而言,我们展示了使用这些信息在实体相似性评估这一关键任务上的性能提升。
引用
@article{arxiv.2409.14584,
title = {The X Types -- Mapping the Semantics of the Twitter Sphere},
author = {Ogen Schlachet Drukerman and Einat Minkov},
journal= {arXiv preprint arXiv:2409.14584},
year = {2024}
}
备注
23 pages