中文

基于多视角视频的学习:利用弱标签进行帧级感知

计算机视觉与模式识别 2024-03-20 v2

摘要

训练一个接受多视角视频的视频动作识别模型时,标注帧级标签既繁琐又困难。然而,标注序列级标签相对容易。这种粗粒度的标注被称为弱标签。然而,使用弱标签训练多视角视频动作识别模型以进行帧级感知具有挑战性。本文提出了一种新颖的学习框架,首先利用弱标签训练一个多视角视频基模型,随后将该基模型用于下游的帧级感知任务。基模型经过训练,可为多视角输入中的每个视角获取独立的潜在嵌入。为了使用弱标签训练模型,我们提出了一种新颖的潜在损失函数。我们还提出了一种模型,该模型利用视角特定的潜在嵌入进行下游的帧级动作识别和检测任务。通过在MM Office数据集上比较多种基线算法,对所提出的框架进行了评估。结果表明,所提出的基模型能够使用弱标签进行有效训练,并且潜在嵌入有助于下游模型提高准确率。

关键词

引用

@article{arxiv.2403.11616,
  title  = {Multi-View Video-Based Learning: Leveraging Weak Labels for Frame-Level Perception},
  author = {Vijay John and Yasutomo Kawanishi},
  journal= {arXiv preprint arXiv:2403.11616},
  year   = {2024}
}