T2Vs Meet VLMs:面向视觉有害性识别的可扩展多模态数据集
计算机视觉与模式识别
2024-10-03 v2
摘要
为解决遭遇不适或有害内容的风险,研究者尝试将多个有害内容数据集与机器学习方法结合,用于检测有害概念。然而,现有有害数据集由狭窄范围的有害对象构成,仅覆盖真实有害内容来源,致使基于此类数据集的方法难以普遍化,可能导致误判。因此,我们提出了全面的有害数据集Visual Harmful Dataset 11K (VHD11K),包含从互联网爬取的10,000张图片和1,000个视频,由4个生成模型生成,覆盖10个有害类别,涵盖具有挑战性定义的全方位有害概念。我们还提出了一种新型标注框架,通过将标注过程形式化为多智能体Visual Question Answering (VQA)任务,让3个不同的VLMs就给定图像/视频是否为有害而"辩论",并在辩论过程中融合情境学习策略。因此,我们可以确保VLMs在就给定图像/视频进行判断前充分考虑其上下文以及双方的论点,从而进一步减少边缘情况下的误判概率。评估和实验结果表明:(1)我们新颖的标注框架与人类标注之间的高度一致,确保了VHD11K的可靠性;(2)我们全方位的有害数据集成功识别了现有有害内容检测方法检测广泛有害内容的能力不足,并提升了现有有害性识别方法的性能;(3)VHD11K在基线数据集SMID方面表现突出,证明其在有害性识别方法上的优势。完整数据集和代码可在 https://github.com/nctu-eva-lab/VHD11K 查找。
引用
@article{arxiv.2409.19734,
title = {T2Vs Meet VLMs: A Scalable Multimodal Dataset for Visual Harmfulness Recognition},
author = {Chen Yeh and You-Ming Chang and Wei-Chen Chiu and Ning Yu},
journal= {arXiv preprint arXiv:2409.19734},
year = {2024}
}
备注
Accepted to NeurIPS'24 Datasets and Benchmarks Track