中文

面向零样本学习的视觉空间优化

计算机视觉与模式识别 2025-10-22 v1 人工智能

摘要

零样本学习旨在识别训练集中未包含的新类别,因其在现实应用中的潜在能力而受到关注。零样本学习模型依赖于学习一个嵌入空间,其中类别的语义描述与样本的视觉特征均可被嵌入以进行最近邻搜索。近来,多数现有工作将深度视觉特征所构成的视觉空间视为嵌入空间的理想选择。然而,样本在视觉空间中的离散分布使得数据结构不显著。我们认为优化视觉空间至关重要,因为它能使语义向量更有效地嵌入到视觉空间中。本工作中,我们提出两种策略来实现此目的。其一为基于视觉原型的方法,其为每个视觉类别学习一个视觉原型,从而在视觉空间中,一个类别可由原型特征而非一系列离散视觉特征表示。其二是优化中间嵌入空间中的视觉特征结构,在该方法中我们成功设计了一种基于多层感知器框架的算法,能够学习公共中间嵌入空间,同时使视觉数据结构更具区分性。通过在四个基准数据集上的广泛实验评估,我们证明了优化视觉空间有益于零样本学习。此外,所提出的基于原型的方法取得了新的 SOTA 性能。

关键词

引用

@article{arxiv.1907.00330,
  title  = {Visual Space Optimization for Zero-shot Learning},
  author = {Xinsheng Wang and Shanmin Pang and Jihua Zhu and Zhongyu Li and Zhiqiang Tian and Yaochen Li},
  journal= {arXiv preprint arXiv:1907.00330},
  year   = {2025}
}