基于联合表示学习与在线聚类的无监督动作分割
计算机视觉与模式识别
2023-08-21 v7
摘要
我们提出一种新颖的无监督活动分割方法,该方法以视频帧聚类作为前置任务,同时执行表示学习与在线聚类。这与先前表示学习与聚类常顺序执行的工作形成对比。我们通过采用时间最优传输来利用视频中的时间信息。具体而言,我们将一个保持活动的时间顺序的时间正则项纳入标准最优传输模块中以计算伪标签聚类分配。该时间最优传输模块使我们的方法能够为无监督活动分割学习有效表示。此外,先前方法需要在以离线方式聚类之前存储整个数据集的学习特征,而我们的方法以在线方式一次处理一个 mini-batch。在三个公开数据集(即 50-Salads、YouTube Instructions 和 Breakfast)以及我们的数据集(即 Desktop Assembly)上的大量评估表明,尽管内存限制显著更小,我们的方法性能与先前方法相当或更好。我们的代码与数据集可在我们的研究网站获取:https://retrocausal.ai/research/
引用
@article{arxiv.2105.13353,
title = {Unsupervised Action Segmentation by Joint Representation Learning and Online Clustering},
author = {Sateesh Kumar and Sanjay Haresh and Awais Ahmed and Andrey Konin and M. Zeeshan Zia and Quoc-Huy Tran},
journal= {arXiv preprint arXiv:2105.13353},
year = {2023}
}
备注
Presented at CVPR 2022