中文

基于语义关系引导的双视角数据幻觉用于小样本图像识别

计算机视觉与模式识别 2024-08-09 v2

摘要

仅从少量图像样本中学习识别新概念极具挑战性,因为学习到的模型容易对少量数据过拟合,导致泛化能力差。一种有前景但尚未被充分探索的解决方案是通过生成合理的样本来补充新类别。然而,该方向的现有工作大多仅利用视觉信息,使得生成的数据容易被少量可用样本中包含的一些挑战性因素所干扰。意识到文本模态中反映人类概念的语义信息,本工作提出了一种新颖的框架,利用语义关系来引导双视角数据幻觉,用于小样本图像识别。所提出的框架能够通过从基类进行有效信息迁移,为新类别生成更多样且更合理的数据样本。具体来说,实例视角数据幻觉模块通过利用从基类派生的局部语义相关注意力和全局语义特征融合,对每个新类别的样本进行幻觉以生成新数据。同时,原型视角数据幻觉模块利用语义感知度量,从少量样本中估计新类别的原型及其相关分布,从而将原型作为一个更稳定的样本获取,并能够重采样大量样本。我们在几个流行的小样本基准上进行了大量实验并与最先进的方法进行了比较,以验证所提出框架的有效性。

关键词

引用

@article{arxiv.2401.07061,
  title  = {Dual-View Data Hallucination with Semantic Relation Guidance for Few-Shot Image Recognition},
  author = {Hefeng Wu and Guangzhi Ye and Ziyang Zhou and Ling Tian and Qing Wang and Liang Lin},
  journal= {arXiv preprint arXiv:2401.07061},
  year   = {2024}
}

备注

Accepted by IEEE Transactions on Multimedia