基于语言的动作概念空间改进视频自监督学习
计算机视觉与模式识别
2023-10-27 v3 机器学习
摘要
近期的对比语言-图像预训练已能学习到高度可迁移且鲁棒的图像表征。然而,以最小监督将这些模型适配到视频领域仍是一个开放问题。我们朝该方向探索了一个简单步骤,使用语言绑定的自监督学习将图像 CLIP 模型适配到视频领域。一个为时间建模修改的主干网络在自蒸馏设置下训练,其训练目标在一个动作概念空间中运作。该空间由通过相关文本提示从语言编码器提取的多种动作概念的特征向量构建。我们引入了两个训练目标——概念蒸馏与概念对齐,在保留原始表征通用性的同时强化动作与其属性之间的关系。我们的方法在三个动作识别基准上提升了零样本与线性探测性能。
引用
@article{arxiv.2307.10922,
title = {Language-based Action Concept Spaces Improve Video Self-Supervised Learning},
author = {Kanchana Ranasinghe and Michael Ryoo},
journal= {arXiv preprint arXiv:2307.10922},
year = {2023}
}
备注
Presented at NeurIPS 2023