嵌入一切:一种高效共嵌入多模态空间的方法
机器学习
2021-10-12 v1 多媒体
摘要
任何通用人工智能系统都必须能够在一个可表示音频、图像、文本等多模态潜空间中解释、操作和生成数据。在过去十年中,深度神经网络在单模态数据分布上取得了显著成功,而迁移学习技术也大幅扩展了跨相关领域的模型复用。然而,从头训练多模态网络仍然昂贵且难以实现,而异构迁移学习(HTL)技术仍相对不成熟。本文中,我们提出一种新颖且经济高效的 HTL 策略用于共嵌入多模态空间。我们的方法通过使用预训练模型对所有组件预处理嵌入,且不通过这些模型传递梯度,从而避免成本低效。我们在一个联合图像-音频嵌入任务中证明了该系统的用途。我们的方法具有广泛的应用前景,因为成功弥合不同潜空间之间的差距可为预期的“通用”嵌入提供框架。
引用
@article{arxiv.2110.04599,
title = {Embed Everything: A Method for Efficiently Co-Embedding Multi-Modal Spaces},
author = {Sarah Di and Robin Yu and Amol Kapoor},
journal= {arXiv preprint arXiv:2110.04599},
year = {2021}
}
备注
7 pages, 4 figures