中文

面向无偏场景图生成的标签语义知识蒸馏

计算机视觉与模式识别 2022-08-09 v1

摘要

场景图生成(SGG)任务旨在检测给定图像中的所有对象及其成对视觉关系。尽管 SGG 在过去几年取得了显著进展,几乎所有现有 SGG 模型都遵循相同的训练范式:它们将 SGG 中的对象与谓词分类均视为单标签分类问题,且真值标签为独热目标标签。然而,这一流行训练范式忽视了当前 SGG 数据集的两个特性:1)对于正样本,某些特定的主-客体实例可能具有多个合理谓词。2)对于负样本,存在大量缺失标注。不顾及这两个特性,SGG 模型容易混淆并做出错误预测。为此,我们提出一种新颖的模型无关标签语义知识蒸馏(LS-KD)以实现无偏 SGG。具体而言,LS-KD 通过将预测的标签语义分布(LSD)与其原始独热目标标签融合,为每个主-客体实例动态生成软标签。LSD 反映了该实例与多个谓词类别之间的相关性。同时,我们提出两种不同的策略来预测 LSD:迭代自蒸馏与同步自蒸馏。在三个 SGG 任务上的大量消融实验与结果证实了我们所提 LS-KD 的优越性与通用性,其能持续在不同谓词类别间取得良好的权衡性能。

关键词

引用

@article{arxiv.2208.03763,
  title  = {Label Semantic Knowledge Distillation for Unbiased Scene Graph Generation},
  author = {Lin Li and Long Chen and Hanrong Shi and Wenxiao Wang and Jian Shao and Yi Yang and Jun Xiao},
  journal= {arXiv preprint arXiv:2208.03763},
  year   = {2022}
}