OmniNet:一种用于多模态多任务学习的统一架构
机器学习
2020-07-06 v2 计算与语言
计算机视觉与模式识别
神经与进化计算
机器学习
摘要
Transformer 是一种被广泛使用的神经网络架构,尤其用于语言理解。我们引入一种扩展且统一的架构,可用于涉及多种模态(如图像、文本、视频等)的任务。我们提出一种时空缓存机制,除对应于时间输入序列的隐藏状态外,还能学习输入的空间维度。所提架构进一步使单一模型支持多输入模态以及异步多任务学习,因此我们称之为 OmniNet。例如,单个 OmniNet 实例可同时学习执行词性标注、图像描述、视觉问答和视频活动识别任务。我们证明,将这四项任务一起训练相比分别训练可得到约三倍压缩的模型,同时保持性能。我们还展示,使用在此前某些模态上预训练的该神经网络有助于学习未见任务,如视频描述与视频问答。这说明了 OmniNet 中时空缓存上自注意力机制的泛化能力。
引用
@article{arxiv.1907.07804,
title = {OmniNet: A unified architecture for multi-modal multi-task learning},
author = {Subhojeet Pramanik and Priyanka Agrawal and Aman Hussain},
journal= {arXiv preprint arXiv:1907.07804},
year = {2020}
}
备注
Source code available at: https://github.com/subho406/OmniNet