中文

解码器在稠密预测任务中是否适用预训练?

机器学习 2025-03-18 v2

摘要

预训练编码器在稠密预测任务中广泛应用,因其能够有效地从图像中提取视觉特征。随后,解码器处理这些特征以生成像素级别的预测。然是的,由于结构差异和输入数据上的变化,只有编码器从诸如图像分类和自监督学习等视觉基准的预学习表示中受益,而解码器通常是从头训练。在本文中,我们提出了 ×\timesNet,通过三种创新设计来促进“预训练编码器 ×\times 预训练解码器”的协作。×\timesNet 使解码器能够直接利用预训练模型,将预学习的表示集成到解码过程,以增强稠密预测任务中的性能。通过简单地将预训练编码器和预训练解码器耦合,×\timesNet 作为一种高度有前景的 method 而脱颖而出。尽管设计简洁,×\timesNet 在单目深度估计和语义分割等任务中超越了先进的方法,尤其在单目深度估计中实现了最先进的性能。

关键词

引用

@article{arxiv.2503.07637,
  title  = {Is Pre-training Applicable to the Decoder for Dense Prediction?},
  author = {Chao Ning and Wanshui Gan and Weihao Xuan and Naoto Yokoya},
  journal= {arXiv preprint arXiv:2503.07637},
  year   = {2025}
}