中文

多样性至关重要:Wikidata中偏差度量的鲁棒性

机器学习 2023-02-28 v1 计算机与社会 信息检索

摘要

随着知识图谱(KG)在各种自动化人工智能系统和应用中的广泛使用,确保利用它们的信息检索算法不受社会偏见影响非常重要。先前的工作已刻画了KG中持续存在的偏差,并采用了若干度量偏差的指标。然而,此类研究缺乏通过变化数据来源或所用嵌入算法对偏差度量的灵敏度进行系统探索。为弥补这一研究空白,本工作中我们对知识图谱上的偏差度量进行了整体分析。首先,我们试图揭示Wikidata中来自七大洲的十三个不同人口统计群体所浮现的数据偏差。接着,我们试图通过两种不同知识图谱嵌入算法——TransE和ComplEx——来揭示偏差检测中的差异。我们针对十三个群体中与敏感属性(即性别)相关的众多职业进行了大量实验。结果表明,KG中持续存在的内在数据偏差可被KG嵌入学习算法所引入的特定算法偏差所改变。进一步,我们表明,无论性别如何,最先进的KG嵌入算法的选择对偏差职业的排序有强烈影响。我们观察到,不同人口统计群体间偏差职业的相似性极小,这反映了全球的社会文化差异。我们相信,这一对偏差度量流程的全面审计将提高社区的认识,同时在得出关于数据与算法设计选择的见解时避免“一刀切”的流行信条。

关键词

引用

@article{arxiv.2302.14027,
  title  = {Diversity matters: Robustness of bias measurements in Wikidata},
  author = {Paramita Das and Sai Keerthana Karnam and Anirban Panda and Bhanu Prakash Reddy Guda and Soumya Sarkar and Animesh Mukherjee},
  journal= {arXiv preprint arXiv:2302.14027},
  year   = {2023}
}

备注

11 pages