面向多模态情感分析的音频引导融合技术
声音
2024-09-10 v1 人工智能
音频与语音处理
摘要
本文提出了用于MER2024情感分析半监督学习轨道(MER-SEMI)的解决方案。首先,为提高特征提取器在情感分类任务上的性能,我们使用标注数据对视频和文本特征提取器进行微调,具体为CLIP-vit-large和Baichuan-13B。该方法有效保留了视频中原始情感信息。其次,我们提出一种音频引导Transformer(AGT)融合机制,利用Hubert-large的鲁棒性,在融合双通道和单通道信息方面表现优异。第三,为提高模型准确率,我们迭代应用自监督学习,将高置信度的无标签数据作为伪标签。最后,通过黑箱探针,我们发现训练集和测试集之间数据分布不平衡。因此,我们采用基于先验知识的投票机制。结果表明,我们的策略有效,最终在MER-SEMI轨道中获得第三名成绩。
引用
@article{arxiv.2409.05007,
title = {Audio-Guided Fusion Techniques for Multimodal Emotion Analysis},
author = {Pujin Shi and Fei Gao},
journal= {arXiv preprint arXiv:2409.05007},
year = {2024}
}