图像字幕的移位窗口傅里叶变换与保留
计算机视觉与模式识别
2024-08-27 v1
摘要
图像字幕是一种在医疗保健和自动驾驶等众多场景中具有实际应用价值的语言和视觉任务。由于许多真实世界应用依赖资源有限的设备,领域内大量工作聚焦于开发更轻便、更快速的模型。然而,当前的优化措施多数集中于 Transformer 架构,忽视了更高效方法的潜力。在本工作中,我们引入了 SwiFTeR,一种几乎完全基于傅里叶变换和 Retention 的架构,以解决当前轻型图像字幕模型的主要效率瓶颈——视觉主干的计算负担以及解码器的二次方成本。SwiFTeR 仅包含 2000 万参数,单次前向传播所需计算量为 3.1 GFLOPs。此外,它在字幕长度上展现出卓越的可扩展性,其较小的内存要求使能够处理更多图像并行度。例如,它每秒可生成 400 条字幕。尽管目前的字幕质量较低(110.2 CIDEr-D),但大部分性能下降并非源于架构本身,而是来自不完整的训练实践,这为后续改进留下了广阔的空间。总体而言,SwiFTeR 指向了新的高效架构设计的可行方向。实现代码将在未来公开。
引用
@article{arxiv.2408.13963,
title = {Shifted Window Fourier Transform And Retention For Image Captioning},
author = {Jia Cheng Hu and Roberto Cavicchioli and Alessandro Capotondi},
journal= {arXiv preprint arXiv:2408.13963},
year = {2024}
}
备注
Pre-print version of paper accepted for ICONIP 2024