中文

SKI 模型:用于理解日常生活活动的骨架诱导视觉-语言嵌入

计算机视觉与模式识别 2025-02-06 v1

摘要

像 CLIP 这样的视觉-语言模型的引入,使得能够泛化到未见视频和人类动作的基础视频模型得以发展。然而,这些模型通常在网络视频上训练,往往无法捕捉日常生活活动(ADL)视频中存在的挑战。现有工作通过结合 3D 骨架和 RGB 视频来解决 ADL 特有的挑战,例如相似的外观、细微的运动模式和多视角。然而,这些方法并未与语言相结合,限制了它们泛化到未见动作类别的能力。在本文中,我们介绍了 SKI 模型,它将 3D 骨架整合到视觉-语言嵌入空间中。SKI 模型利用一个骨架-语言模型 SkeletonCLIP,通过协作训练将骨架信息注入视觉语言模型(VLMs)和大型视觉语言模型(LVLMs)。值得注意的是,SKI 模型在推理期间不需要骨架数据,增强了其在真实世界应用中的鲁棒性。SKI 模型的有效性在三个流行的 ADL 数据集上针对零样本动作识别和视频描述生成任务得到了验证。

关键词

引用

@article{arxiv.2502.03459,
  title  = {SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily Living},
  author = {Arkaprava Sinha and Dominick Reilly and Francois Bremond and Pu Wang and Srijan Das},
  journal= {arXiv preprint arXiv:2502.03459},
  year   = {2025}
}