通过深度典型相关学习文本、音频与视频间关系用于多模态语言分析
机器学习
2019-12-03 v2 机器学习
摘要
多模态语言分析常考虑基于文本的特征与基于声学和视觉属性的特征之间的关系。在情感分析或情绪识别任务中,文本特征通常优于非文本特征,部分原因是文本特征源自在海量数据源上训练的先进语言模型或词嵌入,而音频和视频特征为人手设计且相对欠发展。鉴于文本、音频和视频以不同方式描述同一话语,我们假设通过学取从文本与音频外积提取的特征(我们称之为基于文本的音频)与类似的基于文本的 video 之间的(隐藏)相关性,可改进多模态情感分析和情绪识别。本文提出一种新模型——交互典型相关网络(ICCN),以学习此类多模态嵌入。ICCN 通过深度典型相关分析(DCCA)学习所有三种模态间的相关性,所提嵌入随后在若干基准数据集上及对比其他 SOTA 多模态嵌入算法进行测试。实证结果与消融研究证实了 ICCN 从所有三种视角捕获有用信息的有效性。
引用
@article{arxiv.1911.05544,
title = {Learning Relationships between Text, Audio, and Video via Deep Canonical Correlation for Multimodal Language Analysis},
author = {Zhongkai Sun and Prathusha Sarma and William Sethares and Yingyu Liang},
journal= {arXiv preprint arXiv:1911.05544},
year = {2019}
}