动作中的手性:通过潜在直线化实现时间感知视频表示学习
计算机视觉与模式识别
2025-09-25 v2
摘要
我们的目标是开发能够敏感地捕捉视觉变化随时间变化的紧凑视频表示。为衡量这种时间敏感性,我们引入了一种新任务:手性动作识别,即需要区分一对随时间相反的动作,例如"打开 vs. 关闭门"、"靠近 vs. 远离某物"、"折叠 vs. 展开纸张"等。此类动作(i)在日常生活中频繁发生,(ii)需要理解简单的时间视觉变化(在对象状态、大小、空间位置、计数等方面),且(iii)已知在许多视频嵌入中难以准确表示。我们的目标是构建时间感知的视频表示,这些表示能够在这些手性对之间实现线性可分性。为此,我们提出了一种自监督适配配方,用于将时间敏感性注入一系列冻结图像特征的序列中。我们的模型基于自动编码器,其潜在空间受感知直线化启发的归纳偏置所主导。我们展示,这导致了该方法在三个数据集上(Something-Something、EPIC-Kitchens和Charade)获得紧凑且时间敏感的视频表示。该方法(i)在大规模视频数据集上预训练的更大视频模型上超越,且(ii)当与这些现有模型结合使用时,可在标准基准测试上实现分类性能的提升。
引用
@article{arxiv.2509.08502,
title = {Chirality in Action: Time-Aware Video Representation Learning by Latent Straightening},
author = {Piyush Bagad and Andrew Zisserman},
journal= {arXiv preprint arXiv:2509.08502},
year = {2025}
}
备注
Project page: https://bpiyush.github.io/lift-website/