VDC:基于多模态大语言模型视觉-语言不一致性的通用数据清洗器
计算机视觉与模式识别
2024-04-02 v2 人工智能
摘要
数据在以数据为中心AI(data-centric AI)这一新兴概念中的重要作用近来被不断强调。遗憾的是,现实世界中的数据集可能包含脏样本,例如来自后门攻击的投毒样本、众包中的噪声标签,甚至二者的混合。此类脏样本的存在使深度神经网络(DNN)脆弱且不可靠。因此,检测脏样本以提升数据集质量与可靠性至关重要。现有检测器仅聚焦于检测投毒样本或噪声标签,在处理其他领域的脏样本时往往泛化能力较弱。本文中,我们发现各类脏样本的一个共性在于图像与关联标签之间的视觉-语言不一致性。为捕捉模态间的语义不一致,我们利用多模态大语言模型(MLLM)在跨模态对齐与推理上的卓越能力,提出通用数据清洗器(VDC)。其包含三个连续模块:视觉问题生成模块,用于生成关于图像的深刻问题;视觉问答模块,借助MLLM回答问题以获取视觉内容语义;随后是视觉答案评估模块,用于评估不一致性。大量实验证明了其在各类别与各类脏样本上的优越性能与泛化能力。代码见\url{https://github.com/zihao-ai/vdc}。
引用
@article{arxiv.2309.16211,
title = {VDC: Versatile Data Cleanser based on Visual-Linguistic Inconsistency by Multimodal Large Language Models},
author = {Zihao Zhu and Mingda Zhang and Shaokui Wei and Bingzhe Wu and Baoyuan Wu},
journal= {arXiv preprint arXiv:2309.16211},
year = {2024}
}
备注
Accepted to ICLR 2024