LEMoN: 使用多模态邻居进行标签错误检测
计算机视觉与模式识别
2025-06-06 v2 机器学习
摘要
图像-文本对的数据库是面向视觉-语言模型开发的关键。然而,这些数据集常常来自从网络抓取的噪声数据,包含许多误标记实例。为了提高下游模型的可靠性,有必要识别并过滤带有错误标题的图像。然而,除了基于图像-标题嵌入相似性的过滤方法外,目前尚无其他方法用于过滤噪声多模态数据,或具体评估噪声标题数据对下游训练的影响。在本工作中,我们提出了LEMoN—a一种用于识别图像-标题数据集中标签错误的方法。该方法利用视觉-语言模型在潜在空间中的多模态邻域来自动识别标签错误。通过在八个数据集和十二个基准测试上的经验评估,我们发现LEMoN在标签错误检测方面超出基准测试超过3%,使用我们的方法过滤后的数据集进行训练可使下游captioning性能提升超过2个BLEU分数。
引用
@article{arxiv.2407.18941,
title = {LEMoN: Label Error Detection using Multimodal Neighbors},
author = {Haoran Zhang and Aparna Balagopalan and Nassim Oufattole and Hyewon Jeong and Yan Wu and Jiacheng Zhu and Marzyeh Ghassemi},
journal= {arXiv preprint arXiv:2407.18941},
year = {2025}
}
备注
Published in ICML 2025