多模态复合编辑与检索综述
计算机视觉与模式识别
2024-09-12 v2 人工智能
信息检索
多媒体
摘要
在现实世界中,跨不同模态的信息丰富且多样,理解并利用各种数据类型来改进检索系统是研究的一个关键重点。多模态复合检索整合了文本、图像和音频等多种模态,以提供更准确、个性化且与上下文相关的结果。为了促进对这一有前景方向的深入理解,本综述深入探讨了多模态复合编辑与检索,涵盖图文复合编辑、图文复合检索以及其他多模态复合检索。在本综述中,我们系统地组织了应用场景、方法、基准、实验和未来方向。多模态学习是大模型时代的热门课题,我们也看到PAMI期刊上发表了一些关于多模态学习和基于transformer的视觉-语言模型的综述。据我们所知,本综述是对多模态复合检索文献的首次全面回顾,是对现有综述中多模态融合的及时补充。为了帮助读者快速跟踪该领域,我们建立了本综述的项目页面,可在 https://github.com/fuxianghuang1/Multimodal-Composite-Editing-and-Retrieval 找到。
引用
@article{arxiv.2409.05405,
title = {A Survey of Multimodal Composite Editing and Retrieval},
author = {Suyan Li and Fuxiang Huang and Lei Zhang},
journal= {arXiv preprint arXiv:2409.05405},
year = {2024}
}
备注
20 pages, 3 figures, and 11 tables