中文

动态视觉语义子嵌入与快速重排序

计算机视觉与模式识别 2023-12-22 v2 信息检索

摘要

跨模态匹配的核心是在统一表征空间中准确度量不同模态间的相似性。然而,相较于某一视角的文本描述,视觉模态具有更多语义变化。因此,数据库中图像通常关联多条文本描述。尽管流行的对称嵌入方法已探索众多模态交互方式,它们往往倾向于提高图像嵌入内多种语义变化的平均表达概率。这导致嵌入的信息熵增大,产生冗余并降低精度。本工作中,我们提出动态视觉语义子嵌入框架(DVSE)以降低信息熵。具体而言,我们通过动态正交约束损失获得一组异构视觉子嵌入。为促使生成的候选嵌入捕捉不同语义变化,我们构造混合分布并采用方差感知加权损失对优化过程赋予不同权重。此外,我们设计快速重排序策略(FR)以高效评估检索结果并提升性能。我们在MSCOCO、Flickr30K和CUB Captions三个基准数据集上,使用四种图像特征编码器和两种文本特征编码器将性能与现有基于集合的方法比较。我们通过消融实验展示各组件作用,并对超参数进行敏感性分析。可视化双向检索与注意力图的定性分析进一步证明了我们的方法编码语义变化的能力。

关键词

引用

@article{arxiv.2309.08154,
  title  = {Dynamic Visual Semantic Sub-Embeddings and Fast Re-Ranking},
  author = {Wenzhang Wei and Zhipeng Gui and Changguang Wu and Anqi Zhao and Dehua Peng and Huayi Wu},
  journal= {arXiv preprint arXiv:2309.08154},
  year   = {2023}
}