H3Former:基于超图的语义感知聚合通过双曲分层对比损失用于细粒度视觉分类
计算机视觉与模式识别
2025-11-14 v1 人工智能
摘要
细粒度视觉分类(FGVC)因类别间细微差异和类内大变异性仍然具有挑战性。现有方法通常依赖特征选择机制或区域提议策略以局部语义区域进行语义分析。然而,这些方法往往无法全面捕获判别线索,同时引入大量类别中性冗余。为解决这些限制,我们提出了 H3Former,一种新颖的标记到区域框架,利用高阶语义关系对局部细粒�表示进行聚合,并采用结构化区域级建模。具体而言,我们提出了语义感知聚合模块(SAAM),其利用多尺度上下文线索动态构建标记之间的加权超图。通过应用超图卷积,SAAM 捕获高阶语义依赖关系,并逐步将标记特征聚合为紧凑的区域级表示。此外,我们引入了双曲分层对比损失(HHCL),在非欧几里得嵌入空间中强制分层语义约束。HHCL 增强了类别间的可分离性和类内一致性,同时保持细粒度类别之间固有的分层关系。在四个标准 FGVC 基准上的全面实验验证了 H3Former 框架的优越性。
引用
@article{arxiv.2511.10260,
title = {H3Former: Hypergraph-based Semantic-Aware Aggregation via Hyperbolic Hierarchical Contrastive Loss for Fine-Grained Visual Classification},
author = {Yongji Zhang and Siqi Li and Kuiyang Huang and Yue Gao and Yu Jiang},
journal= {arXiv preprint arXiv:2511.10260},
year = {2025}
}