中文

面向不想要的视觉数据的文本训练:OOD和仇恨图像检测案例研究

计算机视觉与模式识别 2024-10-25 v2

摘要

在本研究中,我们探索了用于检测潜伏于视觉数据集中的不想要内容的方法。我们提供理论分析,表明仅使用文本数据即可获得能够成功划分视觉数据的模型。基于分析,我们提出Hassle-Free Textual Training(HFTT),一种能够仅使用合成文本数据结合预训练视觉语言模型获取不想要视觉内容检测器的简化方法。HFTT特色是显著减少人工数据标注的必要性的创新目标函数。此外,HFTT采用巧妙的文本数据合成方法,有效在无额外成本下模拟将未知视觉数据分布整合到训练过程。HFTT的独特特征超越传统离群检测,适用于处理更抽象概念的任务。我们补充了离群检测和仇恨图像检测实验.代码可在https://github.com/Saehyung-Lee/HFTT获取。

关键词

引用

@article{arxiv.2409.19840,
  title  = {Textual Training for the Hassle-Free Removal of Unwanted Visual Data: Case Studies on OOD and Hateful Image Detection},
  author = {Saehyung Lee and Jisoo Mok and Sangha Park and Yongho Shin and Dahuin Jung and Sungroh Yoon},
  journal= {arXiv preprint arXiv:2409.19840},
  year   = {2024}
}

备注

NeurIPS 2024