中文

面向无标签目标数据的多模态跨域少样本学习用于轨迹动作识别

光学 2024-10-29 v1 应用物理

摘要

我们解决了一个新颖的跨域少样本学习任务 (CD-FSL),该任务针对轨迹动作识别的多模态输入和无标签目标数据。本文同时解决了轨迹动作识别在 CD-FSL 设置下的两个关键挑战:(1) 轨迹视频中的极端域间差异(例如日常场景 vs. 工业场景);(2) 实际应用中的计算成本。我们提出了 MM-CDFSL,一种具有域适应性和计算高效性的方法,旨在增强对目标域的适应性并提高推理成本。为解决第一个挑战,我们提出将多模态蒸馏纳入学生 RGB 模型,使用教师模型。每个教师模型分别在源数据和目标数据上为其各自的模态进行训练。仅利用无标签目标数据进行多模态蒸馈可增强学生模型对目标域的适应性。我们进一步引入了 ensemble masked inference 技术,通过遮蔽来减少输入 token 的数量。在该方法中,ensemble 预测可有效缓解遮蔽导致的性能下降,有效解决了第二个问题。我们的方法在多个轨迹数据集上击败了最新的 CD-FSL 方法,平均在 1-shot/5-shot 设置下分别提升了 6.12/6.10 分,同时实现了 2.22.2 倍的推理速度加快。项目页面: https://masashi-hatano.github.io/MM-CDFSL/

关键词

引用

@article{arxiv.2405.19916,
  title  = {Integrated diode lasers for the generation of sub-GHz repetition rate frequency combs},
  author = {Anzal Memon and Albert van Rees and Jesse Mak and Youwen Fan and Peter van der Slot and Hubertus Bastiaens and Klaus-J Boller},
  journal= {arXiv preprint arXiv:2405.19916},
  year   = {2024}
}

备注

This manuscript is under review for publication with optics express