中文

轻量级跨模态表示学习

机器学习 2024-09-10 v3 人工智能

摘要

低成本的跨模态表示学习对于在文本、音频、图像和视频等多种模态中提取语义表示至关重要。传统方法通常依赖于从头开始训练的大型专用模型,这需要庞大的数据集,并导致高昂的资源与时间成本。为了克服这些挑战,我们引入了一种名为轻量级跨模态表示学习(LightCRL)的新方法。该方法使用一个名为深度融合编码器(DFE)的单一神经网络,将来自多种模态的数据投影到一个共享的潜在表示空间中。这减少了整体参数量,同时仍能提供与更复杂系统相当且稳健的性能。

关键词

引用

@article{arxiv.2403.04650,
  title  = {Lightweight Cross-Modal Representation Learning},
  author = {Bilal Faye and Hanane Azzag and Mustapha Lebbah and Djamel Bouchaffra},
  journal= {arXiv preprint arXiv:2403.04650},
  year   = {2024}
}