视频中熵驱动的无监督关键点表征学习
计算机视觉与模式识别
2023-06-07 v2 机器学习
摘要
从视频中提取信息丰富的表征对于有效学习各种下游任务至关重要。我们提出一种从视频中无监督学习有意义表征的新方法,利用量化图像中逐像素信息的图像空间熵(ISE)概念。我们认为,像素邻域的局部熵及其时间演化创造了用于学习显著特征的有价值的内在监督信号。基于该思想,我们将视觉特征抽象为关键点的简洁表征,其充当动态信息传输器,并设计了一个深度学习的模型,以纯粹无监督的方式直接从视频帧中学习空间和时间一致的表征。两个基于局部熵计算的原始信息论损失引导我们的模型发现一致的关键点表征:一个损失最大化关键点所覆盖的空间信息,另一个损失优化关键点随时间的信息传输。我们将我们的关键点表征与用于各种下游任务(如学习目标动态)的强基线进行比较。我们的实证结果表明,这种信息驱动的关键点性能更优,能够解决诸如关注静态与动态物体或突然进入和离开场景的物体等挑战。
引用
@article{arxiv.2209.15404,
title = {Entropy-driven Unsupervised Keypoint Representation Learning in Videos},
author = {Ali Younes and Simone Schaub-Meyer and Georgia Chalvatzaki},
journal= {arXiv preprint arXiv:2209.15404},
year = {2023}
}
备注
29 pages, 14 figures, Accepted at ICML 2023