面向情感视频分析的轻量化模型
计算机视觉与模式识别
2025-03-26 v2 人工智能
摘要
本研究提出了一种利用 MobileNetV4 和多尺度 3D MLP-Mixer 基于的时空特征提取方法。MobileNetV4 采用其通用倒置瓶颈(UIB)模块作为主干网络,用于从输入图像序列中提取分层特征表示,确保计算效率和丰富的语义编码。为捕获时序依赖性,我们引入三层 MLP-Mixer 模块,该模块在保持结构完整性的同时,在多个分辨率上处理空间特征。在 ABAW 第八届竞赛上的实验结果表明,我们方法的有效性,展示了在情感行为分析中的前景表现。通过将高效视觉主干与结构化时序建模机制相结合,所提框架在计算效率和预测准确性之间取得了平衡,适用于移动和嵌入式计算环境中的实时应用。
引用
@article{arxiv.2503.10530,
title = {Lightweight Models for Emotional Analysis in Video},
author = {Quoc-Tien Nguyen and Hong-Hai Nguyen and Van-Thong Huynh},
journal= {arXiv preprint arXiv:2503.10530},
year = {2025}
}
备注
https://github.com/PRVSL/abaw-8th