中文

多模态大语言模型在图像、文本和语音数据增强中的综述

计算机视觉与模式识别 2025-03-25 v2

摘要

过去五年间,研究从传统机器学习(ML)和深度学习方法转向利用大语言模型(LLM),包括多模态方法,用于数据增强,以提升泛化性并缓解深度卷积神经网络训练中的过拟合问题。然而,现有综述主要聚焦于ML和DL技术或局限于单一模态(文本或图像),而缺乏对LLM基于多模态方法在数据增强最新进展的系统梳理。本综述填补了这一空白,探讨了近期文献中利用多模态 LLM 对图像、文本和音频数据进行增强的研究,全面了解了这些过程。我们梳理了 LLM 在图像、文本和语音增强中采用的各种方法,讨论了当前方法识别出的局限性。此外,我们从文献中识别出针对这些局限性的潜在解决方案,以提升基于多模态 LLM 的数据增强实践效果。本综述为未来研究提供了基础,旨在 refined and 扩大多模态 LLM 在提升深度学习应用数据集质量和多样性方面的应用。

关键词

引用

@article{arxiv.2501.18648,
  title  = {Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey},
  author = {Ranjan Sapkota and Shaina Raza and Maged Shoman and Achyut Paudel and Manoj Karkee},
  journal= {arXiv preprint arXiv:2501.18648},
  year   = {2025}
}

备注

52 pages