场景结构引导网络:将图划分展开为像素级特征学习
计算机视觉与模式识别
2025-06-04 v2 人工智能
摘要
理解场景中的有效结构对底层视觉任务至关重要。遗憾的是,由于视觉特征的影响因任务而异,难以给出有效结构的具体视觉定义。本文提出一种通用神经网络架构,用于提取场景的任务特定结构引导。为此,我们首先分析传统的谱聚类方法,其计算一组特征向量以建模在图像域上形成紧凑小结构的分割图。随后我们将传统的图划分问题展开为一个可学习网络,称为场景结构引导网络(SSGNet),以表示任务特定的有效结构。SSGNet产生一组特征向量系数,给出图像结构的显式特征表示。此外,我们的SSGNet轻量(约56K参数),可作为即插即用模块用于现有架构。我们通过提出两种新颖的训练损失在无监督下优化SSGNet,迫使任务特定场景结构在训练中生成。主要贡献在于表明这样一个简单网络能在若干底层视觉应用上取得最先进结果。我们还证明相比使用结构嵌入框架的现有方法,我们的网络在未见数据集上泛化良好。进一步提出更轻量的SSGNet版本(约29K参数)用于深度计算,即SSGNet-D,并成功部署于Jetson AGX Orin等边缘计算设备,以极小计算延迟提升基线网络性能,即便在真实场景中亦然。
引用
@article{arxiv.2301.00555,
title = {Scene Structure Guidance Network: Unfolding Graph Partitioning into Pixel-Wise Feature Learning},
author = {Jisu Shin and Seunghyun Shin and Hae-Gon Jeon},
journal= {arXiv preprint arXiv:2301.00555},
year = {2025}
}
备注
35 pages, 14 figures, journal extension version of SSGNet (https://ojs.aaai.org/index.php/AAAI/article/view/25322)