中文

O-Dang!:危险言论消息本体

计算与语言 2022-07-22 v1

摘要

在 NLP 社区内部,每天都有大量语言资源被创建、标注并发布,以研究特定语言现象。尽管已做出多种尝试来组织此类资源,但系统方法的缺失以及资源间可能的互操作性问题依然存在。此外,在存储语言信息时,时至今日最常见的做法仍是“黄金标准”这一概念,这与近期 NLP 中强调在训练机器学习和深度学习方法时不同主体性与视角重要性的趋势相悖。本文我们提出 O-Dang!:危险言论消息本体,一个用于收集语言标注数据的系统化、可互操作知识图谱(KG)。O-Dang! 旨在根据语言关联开放数据社区共享的原则,将意大利语数据集收集并组织为结构化 KG。该本体还被设计为考虑视角主义方法,因其提供了在 KG 中编码黄金标准与单标注者标签的模型。本文结构如下:第 1 节概述了工作的动机;第 2 节描述了 O-Dang! 本体,其为 KG 中数据集的集成提供了通用语义模型;第 3 节介绍了关于语料库、用户与标注的本体填充阶段;最后,第 4 节提供了跨语料库的攻击性分析,作为该资源的首个案例研究。

关键词

引用

@article{arxiv.2207.10652,
  title  = {O-Dang! The Ontology of Dangerous Speech Messages},
  author = {Marco A. Stranisci and Simona Frenda and Mirko Lai and Oscar Araque and Alessandra T. Cignarella and Valerio Basile and Viviana Patti and Cristina Bosco},
  journal= {arXiv preprint arXiv:2207.10652},
  year   = {2022}
}