通过时间对齐从非配对自我-外部视频中学习细粒度视角不变表征
计算机视觉与模式识别
2023-11-28 v2
摘要
人类活动的自我中心与外部中心视角看起来截然不同,但连接二者的不变表征对于机器人与增强现实中的许多潜在应用至关重要。已有工作局限于从配对同步视角学习视角不变特征。我们放宽了这一强数据假设,提出通过对齐自我中心与外部中心视频的时间来学习对视角不变的细粒度动作特征,即便视频非同时捕获或处于不同环境。为此,我们提出AE2,一种具有两项关键设计的自监督嵌入方法:(1)显式关注手部与活动物体对应区域的对象中心编码器;以及(2)利用时间反转帧作为负样本的基于对比的对齐目标。为评估,我们建立了自我-外部语境下细粒度视频理解的基准,包含四个数据集——包括我们收集的自我中心网球正手数据集,以及为每个数据集标注的密集逐帧标签。在四个数据集上,我们的AE2方法在常规与跨视角设置下的多种细粒度下游任务中均大幅优于已有工作。
引用
@article{arxiv.2306.05526,
title = {Learning Fine-grained View-Invariant Representations from Unpaired Ego-Exo Videos via Temporal Alignment},
author = {Zihui Xue and Kristen Grauman},
journal= {arXiv preprint arXiv:2306.05526},
year = {2023}
}
备注
Accepted by NeurIPS 2023, Project website: https://vision.cs.utexas.edu/projects/AlignEgoExo/