中文

面向情感视频分析的轻量化模型

计算机视觉与模式识别 2025-03-26 v2 人工智能

摘要

本研究提出了一种利用 MobileNetV4 和多尺度 3D MLP-Mixer 基于的时空特征提取方法。MobileNetV4 采用其通用倒置瓶颈(UIB)模块作为主干网络,用于从输入图像序列中提取分层特征表示,确保计算效率和丰富的语义编码。为捕获时序依赖性,我们引入三层 MLP-Mixer 模块,该模块在保持结构完整性的同时,在多个分辨率上处理空间特征。在 ABAW 第八届竞赛上的实验结果表明,我们方法的有效性,展示了在情感行为分析中的前景表现。通过将高效视觉主干与结构化时序建模机制相结合,所提框架在计算效率和预测准确性之间取得了平衡,适用于移动和嵌入式计算环境中的实时应用。

关键词

引用

@article{arxiv.2503.10530,
  title  = {Lightweight Models for Emotional Analysis in Video},
  author = {Quoc-Tien Nguyen and Hong-Hai Nguyen and Van-Thong Huynh},
  journal= {arXiv preprint arXiv:2503.10530},
  year   = {2025}
}

备注

https://github.com/PRVSL/abaw-8th