中文

超越纯视觉:多模态与时间数据上的自监督表示学习综述

机器学习 2022-06-09 v2 计算机视觉与模式识别

摘要

近来,自监督表示学习(SSRL)在计算机视觉、语音、自然语言处理(NLP)领域备受关注,且近期也出现在其他类型模态中,包括来自传感器的时序数据。自监督学习的流行源于传统模型通常需要大量精标注数据用于训练,而获取标注数据可能困难且昂贵。自监督方法通过使用从原始数据中免费获得的监督信号对模型进行判别性预训练,来提高训练数据的效率。与现有主要关注 CV 或 NLP 单模态领域 SSRL 方法的综述不同,我们旨在提供首个关于时序数据多模态自监督学习方法的全面综述。为此,我们 1)对现有 SSRL 方法进行全面分类,2)通过定义 SSRL 框架的关键组件给出通用流程,3)从目标函数、网络架构和潜在应用方面比较现有模型,4)回顾每类及各种模态下的现有多模态技术。最后,我们指出存在的不足与未来机遇。我们相信本工作为利用多模态和/或时序数据的领域中对 SSRL 的需求建立了视角。

关键词

引用

@article{arxiv.2206.02353,
  title  = {Beyond Just Vision: A Review on Self-Supervised Representation Learning on Multimodal and Temporal Data},
  author = {Shohreh Deldari and Hao Xue and Aaqib Saeed and Jiayuan He and Daniel V. Smith and Flora D. Salim},
  journal= {arXiv preprint arXiv:2206.02353},
  year   = {2022}
}

备注

36 pages, 5 figures, 9 tables, Survey paper