Transformer 神经自回归流
机器学习
2024-01-04 v1
摘要
密度估计是机器学习的核心问题,可通过归一化流(NFs)实现。NFs 由一系列可逆变换组成,利用变量替换定理将复杂的目标分布转化为简单分布。神经自回归流(NAFs)和块神经自回归流(B-NAFs)可以说是 NF 家族中性能最优的成员。然而,由于网络结构上的约束,它们存在可扩展性问题和训练不稳定性。本文提出了一种新颖的解决方案,利用 transformer 定义了一类新的神经流,称为 Transformer 神经自回归流(T-NAFs)。T-NAFs 将随机变量的每个维度视为独立的输入 token,并使用注意力掩码来强制施加自回归约束。我们采用了一种受摊销推断启发的方法,由 transformer 输出可逆变换的参数。实验结果表明,在 UCI 基准测试的多个数据集上,T-NAFs 始终能够匹敌或超越 NAFs 和 B-NAFs。值得注意的是,T-NAFs 使用的参数量比先前方法少一个数量级,且无需组合多个流即可取得这些结果。
引用
@article{arxiv.2401.01855,
title = {Transformer Neural Autoregressive Flows},
author = {Massimiliano Patacchiola and Aliaksandra Shysheya and Katja Hofmann and Richard E. Turner},
journal= {arXiv preprint arXiv:2401.01855},
year = {2024}
}