基于视频的自监督类嵌入学习
计算机视觉与模式识别
2019-10-29 v1
摘要
本工作探索如何利用视频上的自监督学习来学习编码姿态与形状信息的类特定图像嵌入。在训练时,提取同一物体类(例如人体上半身)视频的两帧,并将每帧编码为一个嵌入。以这些嵌入为条件,解码器网络的任务是将一帧变换为另一帧。为成功执行长距离变换(例如一幅图像中放下的手腕应映射到另一幅图像中抬起的手腕),我们引入了一种分层概率网络解码器模型。一旦训练完成,该嵌入可用于多种下游任务与领域。我们在三个不同的可变形物体类——人体全身、上半身、人脸——上定量展示了我们的方法,并通过实验表明所学嵌入确实具有泛化能力。与在相同数据集上训练的其他自监督方法相比,它们取得了最先进的性能,并接近全监督方法的性能。
引用
@article{arxiv.1910.12699,
title = {Self-supervised learning of class embeddings from video},
author = {Olivia Wiles and A. Sophia Koepke and Andrew Zisserman},
journal= {arXiv preprint arXiv:1910.12699},
year = {2019}
}
备注
4th International Workshop on Compact and Efficient Feature Representation and Learning in Computer Vision 2019