通过稀疏率约简实现白盒 Transformer
机器学习
2023-06-05 v1
摘要
在本文中,我们主张表示学习的目标是将数据(例如 token 集合)的分布压缩并转换为支撑于不相干子空间上的低维高斯混合分布。最终表示的质量可由一个称为稀疏率约简的统一目标函数度量。从这一视角,诸如 transformer 等流行的深度网络可自然视为实现对该目标进行增量优化的迭代格式。特别地,我们表明标准 transformer 块可由此目标互补部分的交替优化导出:多头自注意力算子可视为通过最小化有损编码率来压缩 token 集合的梯度下降步,随后的多层感知机可视为试图稀疏化 token 的表示。这导出了一系列数学上完全可解释的白盒类 transformer 深度网络架构。尽管简单,实验表明这些网络确实学习优化所设计的目标:它们压缩并稀疏化大规模真实世界视觉数据集(如 ImageNet)的表示,并取得与精心设计的 transformer(如 ViT)非常接近的性能。代码见 \url{https://github.com/Ma-Lab-Berkeley/CRATE}。
引用
@article{arxiv.2306.01129,
title = {White-Box Transformers via Sparse Rate Reduction},
author = {Yaodong Yu and Sam Buchanan and Druv Pai and Tianzhe Chu and Ziyang Wu and Shengbang Tong and Benjamin D. Haeffele and Yi Ma},
journal= {arXiv preprint arXiv:2306.01129},
year = {2023}
}
备注
33 pages, 11 figures