中文

基于多头注意力驱动的动态视觉-语义嵌入以提升图像-文本匹配

计算机视觉与模式识别 2024-12-30 v1 计算与语言

摘要

随着多模态学习的快速发展,作为连接视觉与语言的桥梁,图像-文本匹配任务变得越来越重要。基于现有研究,本文提出一种创新的视觉语义嵌入模型——多头共识感知视觉-语义嵌入(MH-CVSE)。该模型在共识感知视觉语义嵌入模型(CVSE)基础上引入多头自注意力机制,以并行方式捕获多个子空间中的信息,显著增强了模型理解和表示图像与文本之间复杂关系的能力。此外,我们采用参数化特征融合策略,以灵活的方式整合不同层级的特征信息,进一步提升了模型的表达能力。在损失函数设计方面,MH-CVSE模型采用动态权重调整策略,根据损失值本身动态调整权重,以便在训练期间更好地平衡不同损失项的贡献。同时,我们引入余弦退火学习率策略,以帮助模型在训练后期更稳定地收敛。在Flickr30k数据集上进行大量实验验证表明,MH-CVSE模型在双向图像和文本检索任务中均优于先前方法,充分证明了其有效性和优越性。

关键词

引用

@article{arxiv.2412.19184,
  title  = {Multi-Head Attention Driven Dynamic Visual-Semantic Embedding for Enhanced Image-Text Matching},
  author = {Wenjing Chen},
  journal= {arXiv preprint arXiv:2412.19184},
  year   = {2024}
}