中文

多模态数据集:厌女、色情与恶性刻板印象

计算机与社会 2021-10-06 v1

摘要

我们现已进入在从互联网抓取的数十亿规模数据集上训练万亿参数机器学习模型的时代。这些庞大数据集的兴起催生了呼吁在生成这些大型数据集时保持谨慎的重要批判性工作。这些工作涉及用于生成数据集的可疑整理实践、万维网上可用的替代文本数据的糟糕质量、常作为大语言模型训练源头的 CommonCrawl 数据集的有问题内容,以及在不透明数据集(WebImageText)上训练的大规模视觉-语言模型(如 OpenAI 的 CLIP 模型)中根深蒂固的偏见。在这些具体警示背景下,我们考察了最近发布的 LAION-400M 数据集,这是一个从 Common-Crawl 数据集解析的图文对经 CLIP 过滤的数据集。我们发现该数据集包含令人不安且露骨的图像与文本对,涉及强奸、色情、恶意刻板印象、种族与民族诽谤及其他极端有问题内容。我们概述了关于大规模数据集现状的众多隐含影响、关切与下游危害,同时为包括 AI 社区、监管者、政策制定者与数据主体在内的各类利益相关者提出开放问题。

关键词

引用

@article{arxiv.2110.01963,
  title  = {Multimodal datasets: misogyny, pornography, and malignant stereotypes},
  author = {Abeba Birhane and Vinay Uday Prabhu and Emmanuel Kahembwe},
  journal= {arXiv preprint arXiv:2110.01963},
  year   = {2021}
}

备注

33 pages