中文

FLAASH: 面向多模态烟草内容分析的流注意力自适应语义层次融合框架

计算机视觉与模式识别 2024-12-10 v2

摘要

社交媒体平台上与烟草相关内容的激增给公共卫生监测和干预带来了重大挑战。本文介绍了一种新颖的多模态深度学习框架,名为流注意力自适应语义层次融合(FLAASH),旨在全面分析烟草相关的视频内容。FLAASH 通过利用受流网络理论启发的层次融合机制,解决了短视频中视觉和文本信息集成的复杂性。我们的方法包含三项关键创新,包括一个捕捉视觉和文本模态之间细微交互的流注意力机制、一个平衡不同层次贡献的自适应加权方案,以及一个选择性强调相关特征的门控机制。这种多方面的方法使 FLAASH 能够有效地处理和分各类烟草相关内容,从产品展示到使用场景。我们在多模态烟草内容分析数据集(MTCAD)上评估了 FLAASH,该数据集是一个来自流行社交媒体平台的大规模烟草相关视频集合。我们的结果表明,在分类准确率、F1 分数和时间一致性方面,该方法显著优于现有方法,超越了当前最先进的技术。在标准视频问答数据集上测试时,所提出的方法也显示出强大的泛化能力。这项工作为公共卫生与人工智能的交叉领域做出了贡献,为分析数字媒体中的烟草推广提供了有效工具。

关键词

引用

@article{arxiv.2410.19896,
  title  = {FLAASH: Flow-Attention Adaptive Semantic Hierarchical Fusion for Multi-Modal Tobacco Content Analysis},
  author = {Naga VS Raviteja Chappa and Page Daniel Dobbs and Bhiksha Raj and Khoa Luu},
  journal= {arXiv preprint arXiv:2410.19896},
  year   = {2024}
}

备注

Under review at Image and Vision Computing Journal; 20 pages, 4 figures, 5 tables