中文

关联开放数据中关于人群与文化的争议性术语的使用情况

计算与语言 2023-11-21 v1 人工智能

摘要

关联开放数据(LOD)中的网络资源通过附加于其上的文本字面值(如标签、注释或评论)而为人类所理解。字面值中的用词未必总是中立的。当字面值中使用过时且带有文化刻板印象的术语时,它们在界面中可能显得冒犯用户,并将刻板印象传播给基于这些数据训练的算法。我们研究了 LOD 中关于人群与文化的争议性术语出现的频率、出现的字面值类型,以及是否存在标记此类术语用法的尝试。在分析中,我们复用了来自一个知识图谱的英语和荷兰语术语,该图谱提供了文化遗产领域专家关于术语争议性的意见。我们考察了这些术语在四个广泛使用的数据集中的出现情况:Wikidata、The Getty Art & Architecture Thesaurus、Princeton WordNet 和 Open Dutch WordNet。部分术语存在歧义,且仅在特定义项下具有争议性。通过应用词义消歧,我们生成了一组与本分析相关的字面值。我们发现,过时、贬义、刻板化的术语频繁出现在描述性和标签性字面值中,例如通常在界面中显示并用于索引的优选标签。在某些情况下,LOD 贡献者会通过字面值中的词语和短语(隐式标记)或链接到资源的属性(显式标记)来标记争议性术语。然而,此类标记在所有数据集中都很少见且不一致。我们的定量与定性洞察有助于开发更系统的方法,以应对通过 LOD 传播刻板印象的问题。

关键词

引用

@article{arxiv.2311.10757,
  title  = {How Contentious Terms About People and Cultures are Used in Linked Open Data},
  author = {Andrei Nesterov and Laura Hollink and Jacco van Ossenbruggen},
  journal= {arXiv preprint arXiv:2311.10757},
  year   = {2023}
}