使用多个随机遮蔽自编码器的概率超图:半监督多模态多任务学习
计算机视觉与模式识别
2025-11-26 v2
摘要
计算机视觉领域通过众多模态的数据显著提升了各种视觉任务的性能。最近,人们大量关注通过遮蔽自编码器(Masked Autoencoders, MAE)进行自监督预训练,这通常用作优化下游任务(如分类或回归)的第一步。由于无需手动标记数据,这一方法非常有用。在本工作中,我们提出了使用遮蔽自编码器构建概率超图(PHG-MAE)的 novel 模型,将经典的神经图工作与现代遮蔽自编码器方法统一于常见的理论框架下。通过对整个模态进行随机遮蔽(而不仅仅是遮蔽补丁),模型在每个前向传递中从超边分布中进行采样。此外,我们采用的方法使标准MAE算法将预训练和微调结合到单个训练循环中。此外,我们的方法使能够创建推理时间集束,这些集束通过聚合提高最终预测性能和一致性。最后,我们展示了可以在集束上应用知识蒸馏,即使模型参数不足100万个时也几乎不损失性能。虽然我们的工作主要关注包含多个世界解释和模态的户外无人机场景,但同样的步骤也可用于其他类似领域,如自动驾驶或室内机器人。为了简化集成外部预训练专家以进行计算机视觉多模态多任务学习(MTL)场景的过程,我们开发了一个数据管道软件。使用该工具,我们创建并发布了一个完全自动的Dronescapes数据集的扩展版本。所有技术细节、代码和复现步骤均公开发布。
引用
@article{arxiv.2510.10068,
title = {Probabilistic Hyper-Graphs using Multiple Randomly Masked Autoencoders for Semi-supervised Multi-modal Multi-task Learning},
author = {Pîrvu Mihai-Cristian and Marius Leordeanu},
journal= {arXiv preprint arXiv:2510.10068},
year = {2025}
}
备注
Submitted to Neurocomputing