中文

多模态数据入湖的语义感知表示:文献综述

机器学习 2024-07-18 v1

摘要

机器学习(ML)正不断渗透到越来越多的应用领域。生成式AI,如大型语言模型(LLM),也被广泛采用于处理文本、音频和视频等多模态数据。虽然趋势是使用越来越大的数据集进行训练,但高效管理这些数据已成为工业界一个重大的实际挑战——数据量翻倍当然不代表质量翻倍。恰恰相反,理解底层数据湖的固有质量和多样性,对于特定应用的ML以及基础模型的微调来说,正成为一个日益严峻的挑战。此外,从不断扩大的数据湖中进行信息检索(IR)因时间序列数据固有的时间维度而变得复杂,必须考虑该维度以确定其语义价值。本研究聚焦于不同的语义感知技术,用于从单模态、多模态和跨模态数据中提取嵌入,以增强在不断增长的数据湖中的IR能力。我们收集了相关文章,以总结关于最先进技术的信息,重点关注嵌入在三种不同数据模态类别中的应用。

关键词

引用

@article{arxiv.2407.12438,
  title  = {Semantic-Aware Representation of Multi-Modal Data for Data Ingress: A Literature Review},
  author = {Pierre Lamart and Yinan Yu and Christian Berger},
  journal= {arXiv preprint arXiv:2407.12438},
  year   = {2024}
}

备注

Accepted at the 50th Euromicro Conference on Software Engineering and Advanced Applications (SEAA) 2024 as a short paper