中文

用于细粒度场景图生成的自适应自训练框架

计算机视觉与模式识别 2024-08-05 v5 人工智能

摘要

场景图生成 (SGG) 模型一直受限于基准数据集的固有问题,如长尾谓词分布和标注缺失问题。在本工作中,我们旨在通过利用未标注的三元组来缓解 SGG 的长尾问题。为此,我们引入了一种用于 SGG 的自训练框架 (ST-SGG),该框架为未标注的三元组分配伪标签,并据此训练 SGG 模型。尽管图像识别领域的自训练已取得显著进展,但由于 SGG 任务固有的语义模糊性和谓词类别的长尾分布等特性,为其设计自训练框架更具挑战性。因此,我们提出了一种名为“带动量的类特定自适应阈值”(CATM) 的新型 SGG 伪标签技术,这是一种可应用于任何现有 SGG 模型的模型无关框架。此外,我们设计了一种图结构学习器 (GSL),在将我们提出的自训练框架应用于基于消息传递神经网络 (MPNN) 的最先进 SGG 模型时尤为有益。我们的大量实验验证了 ST-SGG 在各种 SGG 模型上的有效性,特别是在提升细粒度谓词类别的性能方面。

关键词

引用

@article{arxiv.2401.09786,
  title  = {Adaptive Self-training Framework for Fine-grained Scene Graph Generation},
  author = {Kibum Kim and Kanghoon Yoon and Yeonjun In and Jinyoung Moon and Donghyun Kim and Chanyoung Park},
  journal= {arXiv preprint arXiv:2401.09786},
  year   = {2024}
}

备注

9 pages; ICLR 2024