用于情感与情绪分类的多模态关系张量网络
计算与语言
2018-06-11 v1
摘要
从视频片段中理解情感吸引了来自语言、音频和视频领域的研究者。当前该领域的大多数多模态研究涉及多种模态融合技术,且大多将视频的各片段独立处理。受 (Zadeh et al., 2017) 和 (Poria et al., 2017) 工作的启发,我们提出我们的架构——关系张量网络(Relational Tensor Network),其中我们利用片段内的模态间交互(片段内),并考虑视频中片段的序列以建模片段间的模态间交互。我们还通过利用更丰富的音频和语言上下文,并结合来自文本的基于细粒度知识的极性分数融合,生成了文本和音频模态的丰富表示。我们在 CMU-MOSEI 数据集上展示了我们模型的结果,并表明我们的模型在情感分类和情绪识别上优于许多基线和 SOTA 方法。
引用
@article{arxiv.1806.02923,
title = {Multimodal Relational Tensor Network for Sentiment and Emotion Classification},
author = {Saurav Sahay and Shachi H Kumar and Rui Xia and Jonathan Huang and Lama Nachman},
journal= {arXiv preprint arXiv:1806.02923},
year = {2018}
}