用于视频对齐与分析的弱监督表示学习
计算机视觉与模式识别
2023-02-09 v1
摘要
视频分析与理解中的许多任务归结为基于帧的特征学习需求,旨在封装相关视觉内容以便简化后续处理。尽管可设想该学习任务的监督策略,但由于标注数据获取困难,自监督与弱监督替代方案更受青睐。本文提出 LRProp——一种新型弱监督表示学习方法,侧重于同类动作视频对之间的时间对齐应用。所提方法使用 transformer 编码器提取帧级特征,并在训练迭代中采用 DTW 算法以确定视频对间的对齐路径。通过称为“成对位置传播”的过程,这些对应关系在各位置的概率分布经由 KL 散度最小化与帧级特征的相似性相匹配。该算法还使用正则化 SoftDTW 损失以更好地调优所学特征。我们的新型表示学习范式在时间对齐任务上持续优于当前最优方法,在若干下游视频分析应用上确立了新的性能标杆。
引用
@article{arxiv.2302.04064,
title = {Weakly-supervised Representation Learning for Video Alignment and Analysis},
author = {Guy Bar-Shalom and George Leifman and Michael Elad and Ehud Rivlin},
journal= {arXiv preprint arXiv:2302.04064},
year = {2023}
}