中文

基于流行度预测的多模态视频特征提取

计算机视觉与模式识别 2025-01-03 v1 人工智能 机器学习

摘要

本工作旨在使用视频本身及其相关特征预测短视频的流行度。流行度通过四个关键参与度指标衡量:观看次数、点赞次数、评论次数和分享次数。本研究以不同的体系结构和训练方法作为 backbone 网络,从而提取视频模态特征。同时,将清理后的视频字幕纳入精心设计的提示框架,并作为视频到文本生成模型的输入,以生成对视频内容的详细文本理解。这些文本随后使用预训练的 BERT 模型编码为向量。基于上述六组向量,为四个预测指标分别训练一个神经网络。此外,本研究基于视频和表格数据进行数据挖掘和特征工程,构建了诸如 hashtag 出现次数总频率、@提及出现次数总频率、视频时长、帧数、帧率以及上线总时长等实用特征。训练了多种机器学习模型,并选取最稳定的 XGBoost 模型。最后,对神经网络和 XGBoost 模型的预测结果进行加权平均,以获得最终结果。

关键词

引用

@article{arxiv.2501.01422,
  title  = {Multi-Modal Video Feature Extraction for Popularity Prediction},
  author = {Haixu Liu and Wenning Wang and Haoxiang Zheng and Penghao Jiang and Qirui Wang and Ruiqing Yan and Qiuzhuang Sun},
  journal= {arXiv preprint arXiv:2501.01422},
  year   = {2025}
}

备注

INFORMS 2024 Data Challenge Competition