用于信息融合的门控多模态单元
机器学习
2017-02-08 v1 机器学习
摘要
本文提出了一种基于门控神经网络的新型多模态学习模型。门控多模态单元(Gated Multimodal Unit, GMU)模型旨在用作神经网络架构中的内部单元,其目的是基于来自不同模态数据的组合寻找中间表征。GMU 学习利用乘法门决定各模态如何影响该单元的激活。它在利用剧情简介和海报进行电影类型多标签分类的场景下进行了评估。GMU 改善了单模态方法的宏 F 值(macro f-score)性能,并优于其他融合策略,包括专家混合模型。随本工作发布了 MM-IMDb 数据集,据我们所知,这是最大的公开可用电影类型预测多模态数据集。
引用
@article{arxiv.1702.01992,
title = {Gated Multimodal Units for Information Fusion},
author = {John Arevalo and Thamar Solorio and Manuel Montes-y-Gómez and Fabio A. González},
journal= {arXiv preprint arXiv:1702.01992},
year = {2017}
}