轻量级跨模态表示学习
机器学习
2024-09-10 v3 人工智能
摘要
低成本的跨模态表示学习对于在文本、音频、图像和视频等多种模态中提取语义表示至关重要。传统方法通常依赖于从头开始训练的大型专用模型,这需要庞大的数据集,并导致高昂的资源与时间成本。为了克服这些挑战,我们引入了一种名为轻量级跨模态表示学习(LightCRL)的新方法。该方法使用一个名为深度融合编码器(DFE)的单一神经网络,将来自多种模态的数据投影到一个共享的潜在表示空间中。这减少了整体参数量,同时仍能提供与更复杂系统相当且稳健的性能。
引用
@article{arxiv.2403.04650,
title = {Lightweight Cross-Modal Representation Learning},
author = {Bilal Faye and Hanane Azzag and Mustapha Lebbah and Djamel Bouchaffra},
journal= {arXiv preprint arXiv:2403.04650},
year = {2024}
}