ScaleVLAD:通过局部描述子的多尺度融合改进多模态情感分析
计算与语言
2021-12-03 v1 人工智能
机器学习
摘要
融合技术是多模态情感分析中的关键研究课题。近期基于注意力的融合展现出比简单基于操作的融合更先进的性能。然而,这些融合工作采用单尺度(即词元级或话语级)单模态表示。这种单尺度融合是次优的,因为不同模态应以不同粒度对齐。本文提出一种名为 ScaleVLAD 的融合模型,利用共享的局部聚合描述子向量(Vectors of Locally Aggregated Descriptors)从文本、视频和音频中收集多尺度表示,以改进未对齐的多模态情感分析。这些共享向量可被视为共享主题以对齐不同模态。此外,我们提出一种自监督偏移聚类损失以保持样本间融合特征的区分性。骨干网络是对应于三种模态的三个 Transformer 编码器,融合模块生成的聚合特征被输入一个 Transformer 加全连接层以完成任务预测。在三个流行的情感分析基准 IEMOCAP、MOSI 和 MOSEI 上的实验表明相对于基线有显著提升。
引用
@article{arxiv.2112.01368,
title = {ScaleVLAD: Improving Multimodal Sentiment Analysis via Multi-Scale Fusion of Locally Descriptors},
author = {Huaishao Luo and Lei Ji and Yanyong Huang and Bin Wang and Shenggong Ji and Tianrui Li},
journal= {arXiv preprint arXiv:2112.01368},
year = {2021}
}