TempCLR:基于对比学习的时间对齐表征
计算机视觉与模式识别
2023-03-31 v2 计算与语言
摘要
视频表征学习已在视频-文本预训练用于零样本迁移中取得成功,其中每个句子被训练为在共同特征空间中接近配对的视频片段。对于长视频,给定一段描述,其句子描述视频的不同片段,通过匹配所有句子-片段对,段落与完整视频被隐式对齐。然而,这种单元级比较可能忽略全局时间上下文,不可避免地限制了泛化能力。本文中,我们提出一种对比学习框架 TempCLR 来显式比较完整视频与段落。由于视频/段落被表示为片段/句子序列,在其时间顺序约束下,我们使用动态时间规整计算句子-片段对上的最小累积代价作为序列级距离。为探索时间动态,我们依据时间粒度打乱视频片段以打破时间连续的一致性。随后,我们获得感知时间信息从而有助于序列对齐的片段/句子表征。除在视频与段落上预训练外,我们的方法也可泛化到视频实例间的匹配。我们在视频检索、动作步骤定位和小样本动作识别上评估了方法,并在全部三个任务上取得一致性能提升。详细消融实验用以佐证方法设计。
引用
@article{arxiv.2212.13738,
title = {TempCLR: Temporal Alignment Representation with Contrastive Learning},
author = {Yuncong Yang and Jiawei Ma and Shiyuan Huang and Long Chen and Xudong Lin and Guangxing Han and Shih-Fu Chang},
journal= {arXiv preprint arXiv:2212.13738},
year = {2023}
}
备注
ICLR 2023 Camera Ready. Code Link: https://github.com/yyuncong/TempCLR