Understanding and Mitigating Toxicity in Image-Text Pretraining Datasets: A Case Study on LLaVA
计算机视觉与模式识别
2025-05-13 v1
摘要
预训练数据集是多模态模型开发的基础,然而它们常来自网络规模语料,具有内在偏见和有害内容。本文调查了 LLaVA 图像-文本预训练数据集中毒性内容的流行程度,探讨了不同模态下有害内容的表现方式。我们呈现了常见毒性类别的全面分析,提出了针对性缓解策略,创建了精炼后的去毒数据集。该数据集删除了 LLaVA 预训练数据集中的 7,531 条有毒图像-文本对。我们提供了实施稳健去毒检测管道的指南。我们的发现强调了主动识别和过滤有害内容——如仇恨言论、露骨图像和针对性骚扰——以构建更负责任和公平的多模态系统的必要性。去毒数据集已开源,可供进一步研究使用。
引用
@article{arxiv.2505.06356,
title = {Understanding and Mitigating Toxicity in Image-Text Pretraining Datasets: A Case Study on LLaVA},
author = {Karthik Reddy Kanjula and Surya Guthikonda and Nahid Alam and Shayekh Bin Islam},
journal= {arXiv preprint arXiv:2505.06356},
year = {2025}
}
备注
Accepted at ReGenAI CVPR2025 Workshop as Oral