MAL:基于聚类掩码和多任务预训练增强xLSTM视觉性能
计算机视觉与模式识别
2024-12-17 v1
摘要
长短期记忆网络(LSTM)传统上在规模化和有效捕获视觉任务中复杂依赖关系方面面临挑战。xLSTM架构旨在解决这些限制,融合指数门控和并行矩阵记忆结构以提升性能和规模化潜力。尽管如此,xLSTM在视觉计算中的潜力尚未得到充分发挥,尤其是缺乏利用自回归技术以提高特征提取能力。本文引入MAL(Cluster-Masked and Multi-Task Pretraining for Enhanced xLSTM Vision Performance),一种新型框架,通过创新的预训练策略增强xLSTM的能力。我们提出了聚类掩码掩码方法,显著改进局部特征捕获并优化图像扫描效率。此外,我们的通用编码器-解码器预训练方法整合了多个任务,包括图像自回归、深度估计和图像分割,从而增强了模型在多样化视觉任务中的适应性和鲁棒性。我们的实验结果表明,MAL超越了传统监督模型,充分释放了xLSTM的规模化潜力,在视觉任务性能方面达到了新的基准。
引用
@article{arxiv.2412.10730,
title = {MAL: Cluster-Masked and Multi-Task Pretraining for Enhanced xLSTM Vision Performance},
author = {Wenjun Huang and Jianguo Hu},
journal= {arXiv preprint arXiv:2412.10730},
year = {2024}
}