高比率 Mixout:重新审视 Mixout 以实现鲁棒的领域泛化
机器学习
2025-10-13 v2 计算机视觉与模式识别
摘要
从强大的预训练权重初始化微调模型并进行集成是一种常见的策略,用于在分布偏移下提高鲁棒性,但由于需要训练和存储多个模型,其计算成本高昂。Dropout 提供了一种轻量级替代方案,通过随机神经元失活来模拟集成;然而,当应用于预训练模型时,它倾向于过度正则化并破坏泛化所需的关键表示。在本工作中,我们研究 Mixout,一种用于领域泛化的随机正则化技术。Mixout 并非失活神经元,而是在训练期间以概率方式将一部分微调权重与其预训练对应权重进行交换,从而在适应与先验知识保留之间保持平衡。我们的研究表明,在领域泛化基准上实现 Mixout 的强性能需要显著较高的掩码概率——ViTs 为 0.9,ResNets 为 0.8。虽然这看似简单的调整,但为领域泛化带来了两个关键优势:(1) 更高的掩码率更强烈地惩罚偏离预训练参数的行为,促进向未见领域的更好泛化;(2) 高比率掩码大幅降低计算开销,将梯度计算减少高达 45%,梯度内存使用减少高达 90%。在五个领域泛化基准(PACS、VLCS、OfficeHome、TerraIncognita 和 DomainNet)上使用 ResNet 和 ViT 架构的实验表明,我们的方法——高比率 Mixout——在显著降低训练成本的同时,达到了与基于集成方法相当的域外准确率。
引用
@article{arxiv.2510.06955,
title = {High-Rate Mixout: Revisiting Mixout for Robust Domain Generalization},
author = {Masih Aminbeidokhti and Heitor Rapela Medeiros and Srikanth Muralidharan and Eric Granger and Marco Pedersoli},
journal= {arXiv preprint arXiv:2510.06955},
year = {2025}
}
备注
WACV 2026: Winter Conference on Applications of Computer Vision 2026