对齐器-编码器:自注意力 Transformer 可作为自转录器
声音
2025-02-11 v1 人工智能
机器学习
音频与语音处理
摘要
现代自动语音识别系统,包括 RNN-Transducer 和基于注意力的编码器-解码器(AED),其设计使得编码器无需改变音频序列信息到嵌入中的时间位置;与最终文本输出的对齐在解码过程中处理。我们发现,近年来采用的基于 Transformer 的编码器实际上能够在前向传播过程中,在解码之前内部执行对齐。这一新现象催生了一种更简单、更高效的模型,即“对齐器-编码器”。为了训练它,我们摒弃了 RNN-T 的动态规划,转而采用 AED 的逐帧交叉熵损失,而解码器则采用 RNN-T 的轻量级纯文本循环,无需学习交叉注意力——它只需从头开始按顺序扫描嵌入帧,每次产生一个标记,直到预测出消息结束。我们进行的实验表明,其性能非常接近最先进水平,包括一种支持长格式识别的特殊推理配置。在一项代表性比较中,我们测得该模型的总推理时间比 RNN-T 快 2 倍,比 AED 快 16 倍。最后,我们发现音频-文本对齐在某一层的自注意力权重中清晰可见,可以说该层执行了“自转录”。
引用
@article{arxiv.2502.05232,
title = {Aligner-Encoders: Self-Attention Transformers Can Be Self-Transducers},
author = {Adam Stooke and Rohit Prabhavalkar and Khe Chai Sim and Pedro Moreno Mengibar},
journal= {arXiv preprint arXiv:2502.05232},
year = {2025}
}