中文

ObjectCompose:评估视觉模型在物体与背景组合变化下的鲁棒性

计算机视觉与模式识别 2024-10-10 v4 人工智能

摘要

鉴于近期视觉模型的大规模多模态训练及其泛化能力,理解其鲁棒性程度对其现实世界部署至关重要。在这项工作中,我们评估了当前视觉模型对各种物体与背景上下文变化的鲁棒性。大多数鲁棒性评估方法引入合成数据集来诱导物体特征(视角、尺度、颜色)的变化,或在真实图像上使用图像转换技术(对抗性变化、常见损坏)来模拟分布偏移。近期的工作探索了利用大语言模型和扩散模型来生成背景变化。然而,这些方法要么缺乏对所做变化的控制,要么扭曲了物体语义,使其不适用于该任务。相反,我们的方法可以在保持物体原始语义和外观的同时,诱导各种物体与背景的变化。为实现这一目标,我们利用文本到图像、图像到文本和图像到分割模型的生成能力,自动生成广泛的物体与背景变化。我们通过修改文本提示或优化文本到图像模型的潜变量和文本嵌入,诱导自然和对抗性背景变化。我们生成了标准视觉数据集的各种版本,将多样且逼真的背景纳入图像中,或在背景中引入颜色、纹理和对抗性变化。我们进行了大量实验,以分析视觉模型在各种任务中对物体与背景上下文变化的鲁棒性。代码见 https://github.com/Muhammad-Huzaifaa/ObjectCompose。

关键词

引用

@article{arxiv.2403.04701,
  title  = {ObjectCompose: Evaluating Resilience of Vision-Based Models on Object-to-Background Compositional Changes},
  author = {Hashmat Shadab Malik and Muhammad Huzaifa and Muzammal Naseer and Salman Khan and Fahad Shahbaz Khan},
  journal= {arXiv preprint arXiv:2403.04701},
  year   = {2024}
}