中文

模态特定大规模预训练编码器在多模态情感分析中的应用研究

计算与语言 2022-10-31 v1 声音 音频与语音处理

摘要

本文研究了模态特定的大规模预训练编码器在多模态情感分析(MSA)中的有效性与实现方式。尽管已有文献报道预训练编码器在多个领域的有效性,传统的MSA方法仅将其用于语言模态,而其应用尚未被充分研究。本文比较了大规模预训练编码器所得特征与传统启发式特征。每种模态各采用一个公开可用的最大规模预训练编码器:视觉、声学与语言模态分别使用CLIP-ViT、WavLM和BERT。在两个数据集上的实验表明,使用领域特定预训练编码器的方法在单模态与多模态场景下均优于使用传统特征的方法。我们还发现,使用编码器中间层的输出优于输出层的输出。代码已发布于https://github.com/ando-hub/MSA_Pretrain。

关键词

引用

@article{arxiv.2210.15937,
  title  = {On the Use of Modality-Specific Large-Scale Pre-Trained Encoders for Multimodal Sentiment Analysis},
  author = {Atsushi Ando and Ryo Masumura and Akihiko Takashima and Satoshi Suzuki and Naoki Makishima and Keita Suzuki and Takafumi Moriya and Takanori Ashihara and Hiroshi Sato},
  journal= {arXiv preprint arXiv:2210.15937},
  year   = {2022}
}

备注

Accepted to SLT 2022