中文

自监督模型在视频中的接触识别效果如何

计算机视觉与模式识别 2024-09-26 v2

摘要

自监督学习 (Self-Supervised Learning, SSL) 模型的视频内容探索揭示了这一领域的动态研究方向,强调其所面临的复杂挑战与独特机遇。尽管已有大量研究,但 SSL 模型检测视频中的物理接触能力仍基本未被探索,尤其是下游监督采用线性探针或完全微调的效果。本文通过采用八种基于卷积神经网络 (CNN) 的视频自监督模型,识别视频序列中物理接触实例。选取 Something-Something v2 (SSv2) 和 Epic-Kitchen (EK-100) 数据集进行评估,因其在 UCF101 和 HMDB51 上取得良好结果且此前在 SSv2 和 EK-100 上的评估有限。此外,这些数据集包含多样化的环境与场景,对于测试基于视频的模型鲁性与准确性至关重要。该方法不仅检验每种模型在识别物理接触方面的效果,还探讨其在动作识别下游任务中的性能。通过此方式,贡献了关于 SSL 模型在解释复杂动态视觉信息方面适应性的宝贵见解。

关键词

引用

@article{arxiv.2408.00498,
  title  = {How Effective are Self-Supervised Models for Contact Identification in Videos},
  author = {Malitha Gunawardhana and Limalka Sadith and Liel David and Daniel Harari and Muhammad Haris Khan},
  journal= {arXiv preprint arXiv:2408.00498},
  year   = {2024}
}

备注

15 pages, 6 figures