中文

超越视觉-语言多任务学习的极限

人工智能 2021-07-29 v1 计算与语言 计算机视觉与模式识别 机器学习

摘要

通过利用从数百个在线电子商务网站收集的大量产品数据,我们构建了 1000 个独特的分类任务,它们共享结构相似的输入数据,由文本与图像共同组成。这些分类任务聚焦于学习不同电商网站的产品层级,使得许多任务相互关联。采用多模态 transformer 模型,我们通过多任务学习(MTL)一并求解这些任务。我们在一个初始的 100 任务数据集上进行了大量实验,以揭示“大规模 MTL”(即超过 100 个任务的 MTL)的最佳实践。从这些实验中,推导出一种最终的统一方法,它由最佳实践与新提议共同构成,例如 DyPa,一种用于自动将任务特定参数分配给可能受益于额外容量的任务的简单启发式方法。使用我们的大规模 MTL 方法,我们成功地在数据集中全部 1000 个任务上训练单一模型,同时仅使用极少的任务特定参数,从而表明有可能将当前 MTL 研究扩展数个数量级。

关键词

引用

@article{arxiv.2107.13054,
  title  = {Exceeding the Limits of Visual-Linguistic Multi-Task Learning},
  author = {Cameron R. Wolfe and Keld T. Lundgaard},
  journal= {arXiv preprint arXiv:2107.13054},
  year   = {2021}
}

备注

10 pages, 7 figures