MMCosine:面向均衡音视细粒度学习的多模态余弦损失
声音
2023-03-14 v2 多媒体
音频与语音处理
摘要
音视学习通过融合来自多个模态的实用信息来帮助全面理解世界。然而,近期研究表明,联合学习模型中单模态编码器的不平衡优化是提升模型性能的瓶颈。我们进一步发现,最新的缓解不平衡方法在一些音视细粒度任务上失效,这类任务对可区分特征分布有更高要求。受余弦损失构建超球面特征空间并实现更低类内角度变异性的成功启发,本文提出多模态余弦损失 MMCosine。它对特征和权重进行模态-wise 归一化,以实现均衡且更优的多模态细粒度学习。我们证明,我们的方法能从权重范数的角度缓解不平衡优化,并充分利用余弦度量的可判别性。大量实验证明了我们方法的有效性,以及与先进多模态融合策略和最新不平衡缓解方法的通用性。
引用
@article{arxiv.2303.05338,
title = {MMCosine: Multi-Modal Cosine Loss Towards Balanced Audio-Visual Fine-Grained Learning},
author = {Ruize Xu and Ruoxuan Feng and Shi-Xiong Zhang and Di Hu},
journal= {arXiv preprint arXiv:2303.05338},
year = {2023}
}