机器能否帮我们回答数据表中第16题,并进而反思不当内容?
人工智能
2022-07-15 v2 计算机视觉与模式识别
计算机与社会
摘要
当前机器学习所依赖的大型数据集引发了关于不当内容的严重问题,例如攻击性、侮辱性、威胁性内容,或可能以其他方式引起焦虑的内容。这呼吁加强数据集文档化,例如使用数据表(datasheets)。除其他主题外,它们鼓励反思数据集的构成。然而,迄今为止这种文档化是手动完成的,因此可能繁琐且易出错,尤其是对于大型图像数据集。在此我们提出一个可谓“循环”的问题:机器能否帮我们反思不当内容,从而回答数据表中的第16题。为此,我们提议利用预训练 transformer 模型中存储的信息来辅助文档化过程。具体而言,基于社会道德价值观数据集的提示微调(prompt-tuning)引导 CLIP 识别潜在不当内容,从而减少人力劳动。随后我们使用词云对发现的不当图像进行文档化,词云基于视觉-语言模型生成的说明文字。以这种方式生成的两个流行大规模计算机视觉数据集——ImageNet 和 OpenImages——的文档表明,机器确实可以帮助数据集创建者回答关于不当图像内容的第16题。
引用
@article{arxiv.2202.06675,
title = {Can Machines Help Us Answering Question 16 in Datasheets, and In Turn Reflecting on Inappropriate Content?},
author = {Patrick Schramowski and Christopher Tauchmann and Kristian Kersting},
journal= {arXiv preprint arXiv:2202.06675},
year = {2022}
}
备注
arXiv admin note: text overlap with arXiv:2110.04222