中文

通过模态预训练与注意力机制提升多模态准确率

人工智能 2020-11-13 v1

摘要

训练多模态网络具有挑战性,且需要复杂架构才能获得合理性能。我们表明,造成此现象的一个原因是各模态收敛速率的差异。为此,我们在对整个网络进行端到端训练之前,先独立预训练多模态架构中特定于模态的子网络。此外,我们表明在预训练后于子网络间加入注意力机制,有助于在模糊场景下识别最重要的模态,从而提升性能。我们证明,通过这两类技巧,一个简单网络即可在包括情感分析、情绪识别和说话人特质识别在内的多项任务上,达到与训练成本高得多的复杂架构相似的性能。

关键词

引用

@article{arxiv.2011.06102,
  title  = {Improving Multimodal Accuracy Through Modality Pre-training and Attention},
  author = {Aya Abdelsalam Ismail and Mahmudul Hasan and Faisal Ishtiaq},
  journal= {arXiv preprint arXiv:2011.06102},
  year   = {2020}
}