中文

基于堆叠集成的多模态特征融合用于视频广告标注

计算机视觉与模式识别 2021-08-03 v1 多媒体

摘要

视频广告的自动标注一直是一个关键且具有挑战性的问题,近年来因其应用在许多领域显而易见而受到越来越多的关注。尽管已作出持续努力,标注任务仍受制于若干挑战,例如高效的特征融合方法备受期待,但在以往研究中未得到充分探索。本文介绍了我们在2021年腾讯广告算法竞赛中针对多模态视频广告标注的方法。具体而言,我们提出了一种新颖的多模态特征融合框架,旨在融合来自多个模态的互补信息。该框架引入基于堆叠的集成方法,以降低不同模态间不同程度噪声与冲突的影响。因此,与以往方法相比,我们的框架可提升标注任务的性能。为实证考察所提框架的有效性与鲁棒性,我们在竞赛数据集上进行了大量实验。所得结果表明,我们的框架显著优于相关方法,并以82.63%的全局平均精度(GAP)在最终排行榜上位居第一。为更好地推动该领域研究,我们将在最终版本中发布代码。

关键词

引用

@article{arxiv.2108.00679,
  title  = {Multimodal Feature Fusion for Video Advertisements Tagging Via Stacking Ensemble},
  author = {Qingsong Zhou and Hai Liang and Zhimin Lin and Kele Xu},
  journal= {arXiv preprint arXiv:2108.00679},
  year   = {2021}
}

备注

1st place in ACM Multimedia Multimodal Video Ads Tagging Competition (2021 Tencent Advertising Algorithm Competition)