FAVOR#:通过新型正随机特征实现锐利注意力核近似
机器学习
2023-02-03 v1 机器学习
摘要
由高斯或 softmax 核诱导的线性算子的高效近似问题通常使用随机特征(RFs)来解决,其产生算子结果的无偏近似。此类算子出现在从核方法到高效 Transformers 的重要应用中。我们提出参数化的、正的、非三角函数的 RFs 来近似高斯和 softmax 核。与传统 RF 近似不同,这些新方法的参数可被优化以减小近似的方差,且最优值可闭式表达。我们表明,我们的方法在实践中实现了方差缩减(小至 倍及更小的方差)并在核回归任务中优于先前方法。利用我们提出的机制,我们还提出 FAVOR#,一种用于 Transformers 中自注意力近似的方法。我们表明 FAVOR# 在语音建模和自然语言处理中优于其他随机特征方法。
引用
@article{arxiv.2302.00787,
title = {FAVOR#: Sharp Attention Kernel Approximations via New Classes of Positive Random Features},
author = {Valerii Likhosherstov and Krzysztof Choromanski and Avinava Dubey and Frederick Liu and Tamas Sarlos and Adrian Weller},
journal= {arXiv preprint arXiv:2302.00787},
year = {2023}
}