中文

面向主观数据的主观群体分歧:通过群体级学习揭示有意义的群体意见

信息检索 2023-07-21 v1 计算与语言 社会与信息网络

摘要

人工标注数据在 AI 系统的公平性中起着关键作用,包括那些涉及改变生活的决策或审核人类创建的网页/社交媒体内容的系统。传统上,在任何学习发生之前,标注者分歧会被解决。然而,研究者正日益将标注者分歧识别为普遍且有意义的现象。他们也质疑当标注者存在分歧时系统的表现。特别是当少数群体观点被忽视时,尤其是在标注者群体中本已代表性不足的群体中。在本文中,我们介绍了 \emph{CrowdOpinion}\footnote{已被 ACL 2023 接收},一种基于无监督学习的方法,利用语言特征和标签分布将相似条目汇聚为更大的标签分布样本。我们尝试了四种生成式聚类和一种基于密度的聚类方法,应用于标签分布与特征的五种线性组合。我们使用了五个公开可用的基准数据集(具有不同水平的标注者分歧),来自社交媒体(Twitter、Gab 和 Reddit)。我们还在真实场景中使用了来自 Facebook 的数据集进行实验,其中标注由平台自身用户通过对帖子作出反应给出。我们将 \emph{CrowdOpinion} 作为标签分布预测任务使用 KL 散度评估,并作为单标签问题使用准确率度量评估。

关键词

引用

@article{arxiv.2307.10189,
  title  = {Subjective Crowd Disagreements for Subjective Data: Uncovering Meaningful CrowdOpinion with Population-level Learning},
  author = {Tharindu Cyril Weerasooriya and Sarah Luger and Saloni Poddar and Ashiqur R. KhudaBukhsh and Christopher M. Homan},
  journal= {arXiv preprint arXiv:2307.10189},
  year   = {2023}
}

备注

Accepted for Publication at ACL 2023