中文

用于视觉-语言表示学习的仿生脉冲分层网络

计算机视觉与模式识别 2023-08-21 v1 人工智能 计算与语言

摘要

随着自监督学习的成功,多模态基础模型在视觉与语言(VL)预训练的驱动下已快速适配广泛的下游任务。最先进的方法通过在大规模数据集上预训练取得了令人印象深刻的性能。然而,弥合两种模态间的语义鸿沟仍是 VL 任务中不可忽视的挑战。在本工作中,我们提出一种高效的计算框架用于多模态对齐,通过引入新颖的视觉语义模块进一步提升 VL 任务的性能。具体而言,我们提出一种灵活的模型,即仿生脉冲分层网络(Artificial-Spiking Hierarchical Networks,ASH-Nets),其结合了人工神经网络(ANNs)与脉冲神经网络(SNNs)的互补优势以丰富视觉语义表示。特别地,我们构建了视觉具象编码器与语义抽象编码器,用以学习连续与离散潜变量,从而增强语义编码的灵活性。考虑到 SNNs 建模的时空特性,我们引入对比学习方法以优化相似样本的输入。这能提升分层网络的计算效率,而难样本增广有益于视觉表示的学习。此外,提出脉冲到文本统一对齐学习(Spiking to Text Uni-Alignment Learning,STUA)预训练方法,其仅依赖文本特征来增强抽象语义的编码能力。我们在多个成熟的下游 VL 任务上验证了性能。实验表明,所提出的 ASH-Nets 取得了具竞争力的结果。

关键词

引用

@article{arxiv.2308.09455,
  title  = {Artificial-Spiking Hierarchical Networks for Vision-Language Representation Learning},
  author = {Yeming Chen and Siyu Zhang and Yaoru Sun and Weijian Liang and Haoran Wang},
  journal= {arXiv preprint arXiv:2308.09455},
  year   = {2023}
}