中文

ColorMAE:探索Masking自编码器中的数据独立掩码策略

计算机视觉与模式识别 2024-07-19 v1 人工智能 机器学习 图像与视频处理

摘要

Masking自编码器(MAE)已成为一种稳健的自监督框架,在广泛的下游任务中展现出卓越的性能。为增加预文本任务的难度并学习更丰富的视觉表示,现有工作聚焦于用更复杂的策略取代标准随机掩码,如对抗引导和教师引导掩码。然而,这些策略依赖于输入数据,常导致模型复杂度增加和额外计算开销以生成掩码模式。这引出了一个问题:我们能否在不依赖输入数据或增加计算成本的情况下,提升MAE的性能?本文引入一种简单且有效的数据独立方法,称为ColorMAE,通过过滤随机噪声生成不同的二值掩码模式。drawing inspiration from color noise in image processing,我们探索了四种类型的滤波器,以获得具有不同空间和语义先验的掩码模式。ColorMAE无需额外可学习参数或计算开销,却显著提升了所学表示。我们提供了全面的经验评估,表明该策略在下游任务中的优势超过随机掩码。值得注意的是,我们报告的在语义分割任务中相对于基线MAE实现提高了2.72的mIoU。

关键词

引用

@article{arxiv.2407.13036,
  title  = {ColorMAE: Exploring data-independent masking strategies in Masked AutoEncoders},
  author = {Carlos Hinojosa and Shuming Liu and Bernard Ghanem},
  journal= {arXiv preprint arXiv:2407.13036},
  year   = {2024}
}

备注

Work Accepted for Publication at ECCV 2024