基于白盒变分 Transformer 的结构化扩散掩码完成
机器学习
2024-04-04 v1 机器学习
摘要
现代学习框架通常通过解决简单预文本任务来学习大量无标签数据中的表示,然后将这些表示作为下游任务的基础。这些网络经验性地设计,通常不可解释、其表示不具结构性且可能存在冗余。其中每一层明确识别和变换数据中结构的白盒深度网络,作为有前景的替代方案。然而,现有的白盒架构仅在带标签数据(如分类)的大规模监督设置中得到验证。在本工作中,我们首次实现可应用于大规模无监督表示学习的白盒设计范式。我们利用扩散、压缩与(掩码)完成之间的根本联系,推导出一种深度类 Transformer 的掩码自编码器架构,称为 CRATE-MAE,其中每一层的作用在数学上完全可解释:它们将数据分布变换为和从结构化表示。广泛的实证评估确认了我们的分析见解。CRATE-MAE 在大规模图像数据集上表现出极具前景的性能,仅使用与标准掩码自编码器相同模型配置下的约30%参数。CRATE-MAE 学习的表示具有显式结构并包含语义含义。代码已公开于 https://github.com/Ma-Lab-Berkeley/CRATE。
关键词
引用
@article{arxiv.2404.02446,
title = {Masked Completion via Structured Diffusion with White-Box Transformers},
author = {Druv Pai and Ziyang Wu and Sam Buchanan and Yaodong Yu and Yi Ma},
journal= {arXiv preprint arXiv:2404.02446},
year = {2024}
}
备注
To be published at ICLR 2024; 44 pages. arXiv admin note: substantial text overlap with arXiv:2311.13110