从自然语言监督推断图像中的冒犯性内容
计算机视觉与模式识别
2021-10-11 v1 人工智能
摘要
对(大规模)预训练模型进行探测或微调,可在众多 NLP 任务中取得最先进性能,近期结合图像数据后甚至在计算机视觉任务中亦然。遗憾的是,这些方法亦带来严重风险。特别是,自动从网络抓取的大规模图像数据集可能含有作为类别的贬损性术语与冒犯性图像,并可能低估特定类别。因此,迫切需要对数据集细致记录并审校其内容。不幸的是,该过程繁琐且易错。我们展示预训练 transformer 自身即为大规模视觉数据集自动审校提供了方法。基于人工标注样本与基于 CLIP 模型的隐式知识,我们证明可选取相关提示词对图像冒犯性进行评级。除此前在 ImageNet 中已识别的隐私侵犯与色情内容外,我们证明本方法可识别更多不当及潜在冒犯性内容。
引用
@article{arxiv.2110.04222,
title = {Inferring Offensiveness In Images From Natural Language Supervision},
author = {Patrick Schramowski and Kristian Kersting},
journal= {arXiv preprint arXiv:2110.04222},
year = {2021}
}