Generalized Category Discovery中的隐藏瓶颈:注意力分散
计算机视觉与模式识别
2025-07-22 v1
摘要
广义类别发现(Generalized Category Discovery, GCD)旨在通过利用已知类别的标签知识,对 unlabeled 数据进行分类,既包括已知类别也包括未知类别。尽管现有方法取得了显著进展,但它们往往忽视了GCD中的一个隐藏瓶颈:注意力分散。具体而言,在处理 unlabeled 数据时,模型倾向于不仅关注图像中的关键物体,还关注任务无关的背景区域,导致特征提取次优。为消除这一瓶颈,我们提出了注意力聚焦机制(Attention Focusing, AF),这是一种自适应机制,旨在通过修剪非信息性 token 来 sharpen 模型的注意力。AF由两个简单而有效的组件构成:Token Importance Measurement(TIME)和Token Adaptive Pruning(TAP),二者按级联方式工作。TIME在多个尺度上量化 token 的重要性,而TAP则利用TIME提供的多尺度重要性分数对非信息性 token 进行修剪。AF是一种轻量级、即插即用的模块,可无缝集成到现有的GCD方法中,且几乎没有额外计算开销。当我们将其集成到一个突出的GCD方法SimGCD中时,AF相对于基线方法可实现最高达15.4%的性能提升,同时几乎没有额外的计算开销。实现代码已提供于https://github.com/Afleve/AFGCD。
引用
@article{arxiv.2507.14315,
title = {A Hidden Stumbling Block in Generalized Category Discovery: Distracted Attention},
author = {Qiyu Xu and Zhanxuan Hu and Yu Duan and Ercheng Pei and Yonghang Tai},
journal= {arXiv preprint arXiv:2507.14315},
year = {2025}
}