图文多模态模型综述
计算与语言
2024-06-21 v3 人工智能
多媒体
摘要
随着大语言模型(LLMs)在自然语言处理(NLP)领域的显著进展,图文多模态模型的发展已引起广泛关注。当前关于图文多模态模型的综述主要聚焦于代表性模型或应用领域,缺乏关于通用技术模型如何影响领域特定模型发展的回顾,而这对该领域研究者至关重要。基于此,本文首先回顾图文多模态模型的技术演进,从早期特征空间的探索,到视觉语言编码结构,再到最新的大模型架构。接下来,从技术演进视角,我们阐释通用图文多模态技术的发展如何促进生物医学领域多模态技术的进步,以及生物医学领域特定数据集的重要性和复杂性。然后,围绕图文多模态模型的任务,我们分析其通用组件与挑战。此后,我们总结通用图文多模态模型的架构、组件与数据,并介绍图文多模态模型在生物医学领域的应用与改进。最后,我们将通用模型发展与应用面临的挑战归类为外部因素与内在因素,进一步细化为 2 个外部因素和 5 个内在因素,并提出针对性解决方案,为未来研究方向提供指导。更多细节与数据请访问我们的 GitHub 页面:\url{https://github.com/i2vec/A-survey-on-image-text-multimodal-models}。
引用
@article{arxiv.2309.15857,
title = {A Survey on Image-text Multimodal Models},
author = {Ruifeng Guo and Jingxuan Wei and Linzhuang Sun and Bihui Yu and Guiyong Chang and Dawei Liu and Sibo Zhang and Zhengbing Yao and Mingjun Xu and Liping Bu},
journal= {arXiv preprint arXiv:2309.15857},
year = {2024}
}