SRL-CLIP:通过结构化语义角色标签实现高效 CLIP 视频适配
计算机视觉与模式识别
2026-05-27 v3
摘要
将 CLIP 适配到视频领域因其语义丰富且表达能力强的表征而日益流行。尽管 CLIP 是一个良好的起点,但它通常需要在大型视频叙述或字幕数据集(如 HowTo100M、WebVid2.5M)上进行后预训练(对比微调)。然而,这类叙述或字幕往往缺乏全面表征视频所需的信息。由于来自文本的学习信号稀疏,视觉学习效率低下,适配需要数百万样本进行后预训练。在本工作中,我们提出:能否高效地适配 CLIP 以实现通用且整体的视频理解?我们使用以结构化且密集的语义角色标签(SRL)标注的视频,这些标签以结构化格式捕捉动作、人物或物体、其属性、副词(方式)和位置,从而整体地表征整个视频。我们从 SRL 生成基于规则的字幕,并证明仅在 2.3 万个视频-字幕对上进行的简单对比微调,就足以学习到强大且可迁移的表征,适用于需要不同感知粒度的多种视频理解任务。我们适配后的 CLIP 模型 SRL-CLIP,在零样本文本到视频检索上表现出与参数量多 4-8 倍、后预训练数据量多至 6000 倍的当前最优模型相当或更优的性能。SRL-CLIP 在多个视频基准上超越了 CLIP,突显了高效学习和改进的表征。
引用
@article{arxiv.2401.07669,
title = {SRL-CLIP: Efficient CLIP Video Adaptation via Structured Semantic Role Labels},
author = {Darshan Singh and Zeeshan Khan and Makarand Tapaswi},
journal= {arXiv preprint arXiv:2401.07669},
year = {2026}
}
备注
Accepted to the CV4Smalls Workshop at CVPR 2026