FE-Adapter:用于视频情感分类器的适配
计算机视觉与模式识别
2024-08-06 v1
摘要
利用大型预训练模型解决特定任务已取得令人印象的成果。然而,完全微调这些日益庞大的模型正变得难以承担资源压力。这导致人们关注更参数高效的迁移学习,主要在同一模态内进行。但这种方法在视频理解方面存在局限,尤其是缺乏合适的预训练模型。为此,本研究引入一种新型跨模态迁移学习方法,从图像迁移到视频,我们称为参数高效的图像到视频迁移学习。我们提出了面部情感适配器(FE-Adapter),用于视频任务的高效微调。该适配器使预训练图像模型——本通常缺乏时序处理能力的模型——能够高效地分析动态视频内容。值得注意的是,它使用的参数数量约为先前方法的 15 倍,同时提升了准确率。我们的在视频情感识别实验表明,FE-Adapter 能在性能和效率上与现有微调方法和视频情感模型相匹配,甚至超过。这一突破凸显了跨模态方法在提升 AI 模型能力方面的潜力,尤其是在需求效率和准确率不断提升的领域,如视频情感分析。
引用
@article{arxiv.2408.02421,
title = {FE-Adapter: Adapting Image-based Emotion Classifiers to Videos},
author = {Shreyank N Gowda and Boyan Gao and David A. Clifton},
journal= {arXiv preprint arXiv:2408.02421},
year = {2024}
}