中文

NICEST:面向鲁棒场景图生成的噪声标签校正与训练方法

计算机视觉与模式识别 2024-04-16 v2

摘要

几乎所有现有的场景图生成(SGG)模型都忽视了主流SGG数据集的ground-truth标注质量,即它们假设:1)所有人工标注的正样本同样正确;2)所有未标注的负样本绝对为背景。本文认为这两个假设均不适用于SGG:存在大量噪声ground-truth谓词标签,破坏了这两个假设并损害了无偏SGG模型的训练。为此,我们提出了一种新颖的SGG噪声标签校正与样本训练策略:NICEST。具体而言,它由NICE和NIST两部分组成,分别通过生成高质量样本和有效的训练策略来排除这些噪声标签问题。NICE首先检测噪声样本,然后为其重新分配更高质量的软谓词标签。NIST是一种基于多教师知识蒸馏的训练策略,使模型能够学习无偏的融合知识。NIST中还设计了一种动态权衡加权策略,以惩罚不同教师的偏差。由于NICE和NIST均具有模型无关的特性,我们的NICEST可无缝集成到任何SGG架构中,以提升其在不同谓词类别上的性能。此外,为了更好地评估SGG模型的泛化能力,我们进一步提出了一个新的基准VG-OOD,通过重新组织流行的VG数据集,并刻意使每个主-客体类别对的训练集与测试集的谓词分布尽可能不同。该新基准有助于解耦基于主-客体类别的频率偏差的影响。在不同主干网络和任务上的大量消融实验与结果证明了NICEST各组件的有效性与泛化能力。

关键词

引用

@article{arxiv.2207.13316,
  title  = {NICEST: Noisy Label Correction and Training for Robust Scene Graph Generation},
  author = {Lin Li and Jun Xiao and Hanrong Shi and Hanwang Zhang and Yi Yang and Wei Liu and Long Chen},
  journal= {arXiv preprint arXiv:2207.13316},
  year   = {2024}
}

备注

Extension of CVPR'22 work (The Devil is in the Labels: Noisy Label Correction for Robust Scene Graph Generation). arXiv admin note: substantial text overlap with arXiv:2206.03014