中文

基于文档的零样本学习中的视觉-语义分解与部分对齐

计算机视觉与模式识别 2024-07-24 v2

摘要

最近的研究表明,来自百科全书的文档作为辅助信息对于零样本学习非常有帮助。现有方法通过对齐文档与对应图像的整个语义来传递知识。然而,它们忽略了语义信息在两者之间并不等价,导致对齐效果次优。本文提出了一种新型网络,从文档和图像中提取多视图语义概念,并对匹配的概念进行对齐,而非整个概念。具体而言,我们提出了语义分解模块,从视觉和文本两侧生成多视图语义嵌入,为部分对齐提供基本概念。为缓解嵌入之间信息冗余的问题,我们提出了局部到语义方差损失以捕获独特的局部细节,以及多语义多样性损失以强化嵌入之间的正交性。随后,引入两个损失函数,根据视图层级和词到补丁层级的语义相关性,对视觉-语义嵌入对进行部分对齐。因此,在三个标准基准测试中,我们 consistently 超过了基于文档的零样本学习中的最先进方法。定性地,我们展示了模型学习到可解释的部分关联。

关键词

引用

@article{arxiv.2407.15613,
  title  = {Visual-Semantic Decomposition and Partial Alignment for Document-based Zero-Shot Learning},
  author = {Xiangyan Qu and Jing Yu and Keke Gai and Jiamin Zhuang and Yuanmin Tang and Gang Xiong and Gaopeng Gou and Qi Wu},
  journal= {arXiv preprint arXiv:2407.15613},
  year   = {2024}
}

备注

Accepted to ACM International Conference on Multimedia (MM) 2024