从易到难:面向稳健全景场景图生成的课程状形状感知特征学习
计算机视觉与模式识别
2024-07-15 v1 人工智能
摘要
全景场景图生成 (PSG) 旨在基于全景分割掩码生成综合的图结构表示。尽管 PSG 在近年来取得了显著进展,但几乎所有现有方法都忽视了形状感知特征的重要性,这些特征本质上关注对象的轮廓和边界。为弥合这一差距,我们提出了一种模型中立的课程状形状感知特征学习策略 (CAFE) 用于 PSG。具体而言,我们将形状感知特征(即掩码特征和边界特征)纳入 PSG,超越仅依赖边界框特征的局限。此外,drawing inspiration from human cognition,我们提出以易到难的方式整合形状感知特征。为实现这一点,我们将 predicates 分为基于认知学习难度的三个组,并相应地将训练过程分为三个阶段。每个阶段都利用专门的关系分类器来区分特定的 predicates 组。随着学习难度的增加,这些分类器都配备了递增复杂的 features。我们还整合了知识蒸馏以保留早期阶段获取的知识。由于其模型中立的特性,CAFE 可以无缝集成到任何 PSG 模型中。大量实验和消融实验在两个 PSG 任务的 robust 和 zero-shot PSG 上都证明了我们提出的 CAFE 的优越性和稳健性,该方法在与现有研究方法相比以显著优势的性能脱颈而出。
引用
@article{arxiv.2407.09191,
title = {From Easy to Hard: Learning Curricular Shape-aware Features for Robust Panoptic Scene Graph Generation},
author = {Hanrong Shi and Lin Li and Jun Xiao and Yueting Zhuang and Long Chen},
journal= {arXiv preprint arXiv:2407.09191},
year = {2024}
}
备注
Accepted by IJCV