一种用于视频广告理解的多模态框架
计算机视觉与模式识别
2021-08-31 v1
摘要
在社交平台上投放视频广告进行在线营销的趋势日益增长,这要求采用自动化方法有效理解广告内容。借助2021年TAAC竞赛的契机,我们开发了一个多模态系统,以提升对广告视频内容进行结构化分析的能力。在我们的框架中,我们将视频结构化分析问题拆解为两个任务,即场景分割与多模态标注。在场景分割中,我们基于时序卷积模块进行时序建模,以预测相邻帧是否属于同一场景。在多模态标注中,我们首先通过NeXt-SoftDBoF聚合帧级特征来计算片段级视觉特征。这些视觉特征进一步辅以文本特征,文本特征利用全局-局部注意力机制从OCR(光学字符识别)和ASR(语音识别)输出中提取有用信息得到。我们的方案在综合考虑定位与预测准确率的度量下取得了0.2470的分数,在2021年TAAC最终排行榜上排名第四。
引用
@article{arxiv.2108.12868,
title = {A Multimodal Framework for Video Ads Understanding},
author = {Zejia Weng and Lingchen Meng and Rui Wang and Zuxuan Wu and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2108.12868},
year = {2021}
}
备注
4 pages; 2 figures; ACM MM 2021 workshop; Tencent Advertising Algorithm Competition ACM Multimedia 2021 Grand Challenge