面向图像-文本匹配的高级多模态深度学习架构
机器学习
2024-06-24 v1 计算与语言
计算机视觉与模式识别
摘要
图像-文本匹配是一种关键的多模态任务,旨在建模图像和文本之间的语义关联作为匹配关系。随着多媒体信息时代的到来,图像和文本数据呈现爆发性增长,如何准确实现对它们之间潜在关联结构的高效精准语义对应已成为学术界和产业界的核心关注议题。本研究深入探讨了当前多模态深度学习模型在处理图像-文本配对任务中的局限性。因此,我们创新性地设计了一种高级多模态深度学习架构,该架构结合了深度神经网络处理视觉信息的高级抽象表示能力与自然语言处理模型处理文本语义理解的优势。通过引入一种新颖的跨模态注意力机制和层次特征融合策略,该模型实现了图像和文本特征空间之间的深度融合和双向交互。此外,我们还优化了训练目标和损失函数,以确保模型在学习过程中能够更好地映射潜在的关联结构。实验表明,与现有的图像-文本匹配模型相比,优化后的新模型在一系列基准数据集上表现显著优于。此外,新模型在大规模和多样化的开放场景数据集上也表现出卓越的泛化性和鲁棒性,即使在面对以前未遇到的复杂情形时,也能保持高水平的匹配性能。
引用
@article{arxiv.2406.15306,
title = {Advanced Multimodal Deep Learning Architecture for Image-Text Matching},
author = {Jinyin Wang and Haijing Zhang and Yihao Zhong and Yingbin Liang and Rongwei Ji and Yiru Cang},
journal= {arXiv preprint arXiv:2406.15306},
year = {2024}
}
备注
arXiv admin note: text overlap with arXiv:2405.17460 by other authors