用于视频分类与推荐的平滑高斯混合模型
计算机视觉与模式识别
2020-12-23 v1 机器学习
摘要
诸如局部聚合描述子向量(VLAD)之类的聚类-聚合技术,以及它们端到端判别训练的等价形式如 NetVLAD,近来在视频分类与动作识别任务中颇受欢迎。这些技术通过将视频帧分配给各簇,并以各帧相对于每簇均值的残差进行聚合来表示视频。由于某些簇可能仅见到极少的视频特定数据,这些特征可能含有噪声。在本文中,我们提出一种新的聚类-聚合方法,称之为平滑高斯混合模型(SGMM),以及其端到端判别训练的等价形式,称之为深度平滑高斯混合模型(DSGMM)。SGMM 通过为该视频训练的高斯混合模型(GMM)的参数来表示每个视频。低计数簇的问题通过用大量视频上训练出的通用背景模型(UBM)来平滑视频特定估计得以解决。SGMM 相对于 VLAD 的主要好处在于平滑性,使其对少量训练样本不那么敏感。我们通过 YouTube-8M 分类任务上的大量实验表明,SGMM/DSGMM 始终以微小但统计显著的幅度优于 VLAD/NetVLAD。我们还展示了使用 LinkedIn 创建的数据集来预测会员是否会观看某上传视频的结果。
引用
@article{arxiv.2012.11673,
title = {Smoothed Gaussian Mixture Models for Video Classification and Recommendation},
author = {Sirjan Kafle and Aman Gupta and Xue Xia and Ananth Sankar and Xi Chen and Di Wen and Liang Zhang},
journal= {arXiv preprint arXiv:2012.11673},
year = {2020}
}
备注
11 pages, 3 figures, 7 tables