单一模型,多种模态:一种用于文本、声音、图像、视频与代码的稀疏激活方法
计算与语言
2022-05-13 v1 计算机视觉与模式识别
机器学习
摘要
人们通过多种感官感知世界(例如通过听声音、读文字和看物体)。然而,大多数现有 AI 系统仅处理单一模态。本文提出一种以单一模型出色处理多种模态信息的方法。在我们的“SkillNet”模型中,参数的不同部分专用于不同模态的处理。与传统密集模型总是激活所有模型参数不同,我们的模型稀疏激活那些技能与任务相关的部分参数。这种模型设计使 SkillNet 能以更具可解释性的方式学习技能。我们针对包括文本、图像、声音、视频和代码在内的五种模态开发模型。结果表明,SkillNet 的性能可与五个模态特定的微调模型相媲美。此外,我们的模型支持以相同稀疏激活方式进行自监督预训练,从而为不同模态提供更好的初始化参数。我们发现预训练显著提升了 SkillNet 在五种模态上的性能,达到甚至优于具有模态特定预训练的基线。在中文文本到图像检索任务上,我们的最终系统在使用更少激活参数的情况下,取得了比包括 Wukong{ViT-B} 和 Wenlan 2.0 在内的现有领先系统更高的准确率。
引用
@article{arxiv.2205.06126,
title = {One Model, Multiple Modalities: A Sparsely Activated Approach for Text, Sound, Image, Video and Code},
author = {Yong Dai and Duyu Tang and Liangxin Liu and Minghuan Tan and Cong Zhou and Jingquan Wang and Zhangyin Feng and Fan Zhang and Xueyu Hu and Shuming Shi},
journal= {arXiv preprint arXiv:2205.06126},
year = {2022}
}