脑类比多模态脉冲神经网络用于图像-文本检索
计算机视觉与模式识别
2026-03-31 v1
摘要
脉冲神经网络(SNNs)最近在单模态视觉和文本任务中展现出强大的潜力,但构建一个直接可训练、低能耗且性能优异的用于多模态应用(如图像-文本检索,ITR)的SNN仍然具有挑战性。现有基于人工神经网络(ANN)的方法常追求更丰富的单模态语义,采用更深更复杂的架构,却忽视了跨模态交互、检索延迟和能源效率。为此,我们提出了受脑类比启发的跨模态脉冲融合网络(Cross-Modal Spike Fusion,CMSF),首次应用于ITR。该提出的脉冲融合机制在脉冲水平上整合单模态特征,生成增强的多模态表征,作为软监督信号以细化单模态脉冲嵌入,有效缓解了CMSF中的语义损失。尽管仅需两个时间步,CMSF即可实现领先的检索准确率,超越了最先进的ANN对手,同时保持极低的能源消耗和高检索速度。本工作标志着多模态SNN的重要一步,提供了一个受脑类比启发的框架,统一了时序动力学与跨模态对齐,为未来基于脉冲的多模态研究提供了新视角。代码已公开于 https://github.com/zxt6174/CMSF。
引用
@article{arxiv.2603.26787,
title = {Brain-Inspired Multimodal Spiking Neural Network for Image-Text Retrieval},
author = {Xintao Zong and Xian Zhong and Wenxuan Liu and Jianhao Ding and Zhaofei Yu and Tiejun Huang},
journal= {arXiv preprint arXiv:2603.26787},
year = {2026}
}