基于全景上下文聚合网络的多标签分类
计算机视觉与模式识别
2025-12-30 v1
摘要
情境建模对于视觉识别至关重要,通过整合图像中对象与标签之间的内在与外在关系,实现高度具辨识度的图像表示。当前方法的局限在于关注基本几何关系或局部特征,常忽略对象之间跨尺度情境相互作用。本文引入深层全景情境聚合网络 (PanCAN),一种新颖方法,通过在高维希尔伯特空间中的跨尺度特征聚合,层次化整合多阶几何情境。具体而言,PanCAN 通过将随机漫步与注意力机制结合,在每个尺度上学习多阶邻域关系。不同尺度的模块级联,其中选取更细尺度上的显著锚点,其邻域特征通过注意力动态融合。这使得有效的跨尺度建模成为可能,通过结合多阶和跨尺度情境感知特征显著提升复杂场景理解。广泛的多标签分类实验在 NUS-WIDE、PASCAL VOC2007 和 MS-COCO 数据集上表明,PanCAN 在定量和定性评估中持续实现具竞争力的结果,超越了领先技术,从而大幅提升了多标签分类性能。
引用
@article{arxiv.2512.23486,
title = {Multi-label Classification with Panoptic Context Aggregation Networks},
author = {Mingyuan Jiu and Hailong Zhu and Wenchuan Wei and Hichem Sahbi and Rongrong Ji and Mingliang Xu},
journal= {arXiv preprint arXiv:2512.23486},
year = {2025}
}