用于跨语言图像描述的嵌入式异构注意力 Transformer
计算机视觉与模式识别
2024-04-08 v2 多媒体
摘要
跨语言图像描述是一项具有挑战性的任务,需要应对多媒体分析中跨语言与跨模态的双重障碍。该任务的关键在于建模图像与不同语言之间的全局与局部匹配。现有基于 transformer 架构的跨模态嵌入方法忽视了图像区域与单语词汇之间的局部匹配,尤其在处理多样语言时。为克服这些局限,我们提出嵌入式异构注意力 Transformer (EHAT),利用异构网络建立图像与不同语言之间的跨域关系与局部对应。EHAT 包含掩码异构交叉注意力 (MHCA)、异构注意力推理网络 (HARN) 与异构协同注意力 (HCA)。HARN 作为核心网络,通过利用视觉边界框表示特征连接两种语言的词特征并学习异构映射来捕获跨域关系。MHCA 与 HCA 通过专门的异构注意力机制促进编码器中的跨域整合,使单一模型能够生成两种语言的描述。我们在 MSCOCO 数据集上评估我们的方法,生成英语与汉语(分属差异显著语系)的描述。实验结果表明,相较现有先进单语方法,我们的方法性能更优。我们提出的 EHAT 框架有效应对了跨语言图像描述的挑战,为改进多语言图像分析与理解铺平了道路。
引用
@article{arxiv.2307.09915,
title = {Embedded Heterogeneous Attention Transformer for Cross-lingual Image Captioning},
author = {Zijie Song and Zhenzhen Hu and Yuanen Zhou and Ye Zhao and Richang Hong and Meng Wang},
journal= {arXiv preprint arXiv:2307.09915},
year = {2024}
}