基于多模态变分编码器-解码器框架的微视频流行度预测
机器学习
2022-01-11 v1 计算与语言
计算机视觉与模式识别
摘要
作为一种新兴的用户生成内容,微视频极大地丰富了人们的娱乐体验和社交互动。然而,单个微视频的流行度模式在研究者中仍不明朗。主要挑战之一是微视频的潜在流行度在各种外部因素影响下趋于波动,使其充满不确定性。此外,由于微视频主要由缺乏专业技术的个人上传,可能存在多种类型的噪声掩盖有用信息。在本文中,我们提出一种用于微视频流行度预测任务的多模态变分编码器-解码器(MMVED)框架。MMVED学习微视频的随机高斯嵌入,该嵌入对其流行度水平具有信息性,同时保留内在不确定性。此外,通过对深度变分信息瓶颈下界(IBLBO)的优化,所学隐表示被证明对流行度目标具有最大表达性,同时对微视频特征中的噪声具有最大压缩性。进一步,贝叶斯专家乘积原则被应用于多模态编码器,其中信息保留或丢弃的决策由所有可用模态综合做出。在公开数据集和我们自西瓜收集的数据集上进行的广泛实验证明了所提MMVED框架的有效性。
引用
@article{arxiv.2003.12724,
title = {Predicting the Popularity of Micro-videos with Multimodal Variational Encoder-Decoder Framework},
author = {Yaochen Zhu and Jiayi Xie and Zhenzhong Chen},
journal= {arXiv preprint arXiv:2003.12724},
year = {2022}
}