何时使用高效自注意力?文本、语音与图像 Transformer 变体的性能剖析
计算与语言
2023-06-16 v1 声音
音频与语音处理
摘要
我们提出了首个跨越文本、语音与视觉的基于自注意力的 Transformer 变体效率的统一研究。利用多种效率指标(延迟、吞吐量与内存),我们确定了高效 Transformer 变体比原始模型更高效时的输入长度阈值(临界点)。为了在语音上开展该分析,我们引入了 L-HuBERT,一种自监督语音模型的新型局部注意力变体。我们观察到这些阈值 (a) 远高于典型数据集序列长度,且 (b) 依赖于指标与模态,表明正确模型的选择取决于模态、任务类型(长文本 vs. 典型上下文)和资源约束(时间 vs. 内存)。通过可视化 Transformer 各组件计算成本的分解,我们还表明非自注意力组件呈现出显著的计算成本。我们在 https://github.com/ajd12342/profiling-transformers 发布了我们的剖析工具包。
引用
@article{arxiv.2306.08667,
title = {When to Use Efficient Self Attention? Profiling Text, Speech and Image Transformer Variants},
author = {Anuj Diwan and Eunsol Choi and David Harwath},
journal= {arXiv preprint arXiv:2306.08667},
year = {2023}
}
备注
10 pages, 6 pages. Accepted to ACL 2023