中文

构建多模态表示的技术是否重要?——比较分析

机器学习 2025-08-08 v1

摘要

通过融合单一模态(如文本、图像或音频)来创建有意义的表示是多模态学习的核心概念。尽管若干构建多模态表示的技术已被证明成功,但它们尚未被比较过。因此在给定场景下预期哪种技术能产生最佳结果、以及选择此类技术时应考虑哪些因素,一直不明确。本文探讨了构建多模态数据表示的最常见技术——晚期融合、早期融合和草图,并在分类任务中对它们进行比较。实验在三个数据集上进行:Amazon Reviews、MovieLens25M 和 MovieLens1M 数据集。总体而言,我们的结果证实多模态表示能够将 Amazon Reviews 上单模态模型的准确率从 0.919 提升至 0.969,将 MovieLens25M 上的 AUC 从 0.907 提升至 0.918。然而,在两个 MovieLens 数据集上的实验表明了有意义输入数据对给定任务的重要性。在本文中,我们表明构建多模态表示的技术选择对于在恰当模态组合下获得尽可能高的模型性能至关重要。这种选择依赖于:各模态对所给机器学习(ML)问题的影响、ML 任务的类型、以及训练和预测阶段的内存约束。

关键词

引用

@article{arxiv.2206.06367,
  title  = {Does a Technique for Building Multimodal Representation Matter? -- Comparative Analysis},
  author = {Maciej Pawłowski and Anna Wróblewska and Sylwia Sysko-Romańczuk},
  journal= {arXiv preprint arXiv:2206.06367},
  year   = {2025}
}