中文

DMSD-CDFSAR: 面向跨域少样本动作识别的混合源域知识蒸馏

计算机视觉与模式识别 2024-07-09 v1

摘要

少样本动作识别是计算机视觉中的一个新兴领域,主要关注同域内的元学习。然而,在真实场景部署中会面临挑战,因为在特定领域内收集大量标注数据既费力又耗时。因此,注意力转向跨域少样本动作识别,这要求模型在存在显著偏差的跨域间具备泛化能力。为此,我们提出了一种名为“混合源域蒸馏”的新方法,专为解决这一难题而设计。我们的方法在训练期间策略性地整合了来自源域标注数据和目标域未标注数据的见解。使用 ResNet18 作为骨干网络,从源域和目标域中提取空间特征。我们设计了两个用于元训练的分支:原始源分支和混合源分支。在第一个分支中,采用域时序编码器捕捉源域和目标域的时序特征。此外,采用域时序解码器重建所有提取的特征。在另一个分支中,使用域混合编码器处理源域标注数据和目标域未标注数据,生成混合源域特征。我们在元训练之前引入了一个预训练阶段,其网络架构与第一个分支相似。最后,我们引入了双重蒸馏机制来细化源域特征的分类概率,使其与混合源域特征的分类概率对齐。这一迭代过程利用混合源分支的知识丰富了原始源分支的见解,从而增强了模型的泛化能力。我们的代码可在 URL: \url{https://xxxx/xxxx/xxxx.git} 获取。

关键词

引用

@article{arxiv.2407.05657,
  title  = {DMSD-CDFSAR: Distillation from Mixed-Source Domain for Cross-Domain Few-shot Action Recognition},
  author = {Fei Guo and YiKang Wang and Han Qi and Li Zhu and Jing Sun},
  journal= {arXiv preprint arXiv:2407.05657},
  year   = {2024}
}