中文

面向图文检索的带常识知识优化的风格Transformer

计算机视觉与模式识别 2023-04-04 v2 多媒体

摘要

关联不同模态的图文检索因其出色的研究价值及广阔的实际应用而受到广泛关注。然而,现有多数方法未充分考量高层语义关系(“风格嵌入”)与来自多模态的常识知识。为此,我们引入一种新颖的带常识知识优化的风格Transformer网络(CKSTN)用于图文检索。其主要模块为常识知识适配器(CKA),包含风格嵌入提取器(SEE)与常识知识优化(CKO)模块。具体而言,SEE 采用序列更新策略以有效连接 SEE 中不同阶段的特性。引入 CKO 模块以动态捕获来自不同模态的常识知识潜在概念。此外,为获取泛化的时序常识知识,我们提出序列更新策略以有效将 SEE 中不同层的特征与先前的常识特征单元相整合。CKSTN 在 MSCOCO 与 Flickr30K 数据集上的图文检索中展现出优于 SOTA 方法的性能。而且,CKSTN 基于轻量级 Transformer 构建,因更优性能与更少参数,更便于且适用于真实场景应用。

关键词

引用

@article{arxiv.2303.00448,
  title  = {The style transformer with common knowledge optimization for image-text retrieval},
  author = {Wenrui Li and Zhengyu Ma and Jinqiao Shi and Xiaopeng Fan},
  journal= {arXiv preprint arXiv:2303.00448},
  year   = {2023}
}