中文

零/少样本多视角 3D 形状识别的 Prompt-增强视角聚合网络

计算机视觉与模式识别 2024-05-01 v1

摘要

大型视觉语言模型在零/少样本场景下的 2D 视觉识别中取得显著进展。本文聚焦于利用大型视觉语言模型(即 CLIP)解决基于多视角表示的零/少样本 3D 形状识别问题。两类任务的关键挑战在于,在无显式训练(零样本 3D 形状识别)或仅限少量数据训练(少样本 3D 形状识别)的场景下,生成针对多个视角图像的判别性描述符。我们分析称,两类任务息息相关,可视为同时解决。具体而言,利用对零样本推理有效的描述符引导在少样本训练中对聚合描述符进行调优,可显著提升少样本学习效果。因此,我们提出 Prompt-增强视角聚合网络 (PEVA-Net) 以同步解决零/少样本 3D 形状识别。在零样本场景下,我们提出利用由候选类别构建的提示词来增强多视角关联视觉特征的聚合过程。得到的聚合特征用于有效地进行 3D 形状的零样本识别。在少样本场景下,我们首先利用变换器编码器将视角关联视觉特征聚合为全局描述符。为调优编码器,除主分类损失外,我们提出一种通过特征蒸馏损失实现自蒸馫的方案,即将零样本描述符作为引导信号用于少样本描述符的调优。这一方案可显著提升少样本学习效果。

关键词

引用

@article{arxiv.2404.19168,
  title  = {PEVA-Net: Prompt-Enhanced View Aggregation Network for Zero/Few-Shot Multi-View 3D Shape Recognition},
  author = {Dongyun Lin and Yi Cheng and Shangbo Mao and Aiyuan Guo and Yiqun Li},
  journal= {arXiv preprint arXiv:2404.19168},
  year   = {2024}
}