中文

MM-AU:面向广告视频的多模态理解

计算机视觉与模式识别 2023-08-29 v1

摘要

广告视频(ads)在互联网电子商务领域中扮演着不可或缺的角色,因为它们能将特定产品的触达范围扩大到广泛受众,或可作为通过简洁叙事结构提高对特定问题认知的媒介。广告的叙事结构涉及若干要素,例如对宽泛内容(主题与潜在信息)的推理,以及考察由特定事件序列和人物互动所引起的感知基调转变等细粒度细节。在本工作中,为促进沿主题分类、感知基调转变和社会信息检测这三个重要维度对广告的理解,我们引入了一个名为 MM-AU 的多模态多语言基准,其由从多个网络来源整理的超过 8.4K 个视频(147 小时)组成。我们通过对广告转录文本应用大语言模型,探索了多种零样本推理基线。此外,我们证明,在基于多模态 transformer 的监督模型中利用包括音频、视频和文本在内的多种模态信号,相较于单模态方法可带来性能提升。

关键词

引用

@article{arxiv.2308.14052,
  title  = {MM-AU:Towards Multimodal Understanding of Advertisement Videos},
  author = {Digbalay Bose and Rajat Hebbar and Tiantian Feng and Krishna Somandepalli and Anfeng Xu and Shrikanth Narayanan},
  journal= {arXiv preprint arXiv:2308.14052},
  year   = {2023}
}

备注

Accepted to ACM Multimedia 2023