中文

嵌入一切:一种高效共嵌入多模态空间的方法

机器学习 2021-10-12 v1 多媒体

摘要

任何通用人工智能系统都必须能够在一个可表示音频、图像、文本等多模态潜空间中解释、操作和生成数据。在过去十年中,深度神经网络在单模态数据分布上取得了显著成功,而迁移学习技术也大幅扩展了跨相关领域的模型复用。然而,从头训练多模态网络仍然昂贵且难以实现,而异构迁移学习(HTL)技术仍相对不成熟。本文中,我们提出一种新颖且经济高效的 HTL 策略用于共嵌入多模态空间。我们的方法通过使用预训练模型对所有组件预处理嵌入,且不通过这些模型传递梯度,从而避免成本低效。我们在一个联合图像-音频嵌入任务中证明了该系统的用途。我们的方法具有广泛的应用前景,因为成功弥合不同潜空间之间的差距可为预期的“通用”嵌入提供框架。

关键词

引用

@article{arxiv.2110.04599,
  title  = {Embed Everything: A Method for Efficiently Co-Embedding Multi-Modal Spaces},
  author = {Sarah Di and Robin Yu and Amol Kapoor},
  journal= {arXiv preprint arXiv:2110.04599},
  year   = {2021}
}

备注

7 pages, 4 figures