中文

面向情感识别的多模态端到端稀疏模型

计算与语言 2021-12-06 v3

摘要

现有的多模态情感计算任务(如情感识别)工作通常采用两阶段流水线,首先用手工设计的算法提取各单模态的特征表示,然后利用提取的特征进行端到端学习。然而,提取的特征是固定的,无法在不同的目标任务上进一步微调,且人工寻找特征提取算法不能很好地泛化或扩展到不同任务,可能导致次优性能。本文开发了一个完全端到端的模型,将两阶段连接起来并联合优化。此外,我们重构了当前的数据集以支持完全端到端训练。进一步,为降低端到端模型带来的计算开销,我们引入了稀疏跨模态注意力机制进行特征提取。实验结果表明,我们的完全端到端模型显著超越了当前基于两阶段流水线的SOTA模型。此外,通过加入稀疏跨模态注意力,我们的模型能在特征提取部分以约一半的计算量保持性能。

关键词

引用

@article{arxiv.2103.09666,
  title  = {Multimodal End-to-End Sparse Model for Emotion Recognition},
  author = {Wenliang Dai and Samuel Cahyawijaya and Zihan Liu and Pascale Fung},
  journal= {arXiv preprint arXiv:2103.09666},
  year   = {2021}
}

备注

12 pages, 6 figures