基于长形式声学编码的分段注意力解码
音频与语音处理
2025-12-17 v1 计算与语言
摘要
我们解决了基于注意力的编码器-解码器(AED)模型与长形式声学编码之间的根本不相容性。在分段话语上训练的 AED 模型通过利用分段边界之外的有限声学上下文来编码绝对帧位置,但在解码这些线索消失的长形式分段时无法泛化。由于交叉注意力中键和值的排列不变性,模型失去了对声学编码排序的能力。我们提出四种修改:(1)向每个解码分段中的交叉注意力注入显式绝对位置编码;(2)使用扩展声学上下文进行长形式训练以消除隐式绝对位置编码;(3)分段拼接以覆盖训练所需的各种分段方式;(4)语义分段以对齐 AED 解码分段与训练分段。我们表明这些修改缩小了连续与分段声学编码之间的准确率差距,使注意力解码器的自回归使用成为可能。
引用
@article{arxiv.2512.14652,
title = {Segmental Attention Decoding With Long Form Acoustic Encodings},
author = {Pawel Swietojanski and Xinwei Li and Mingbin Xu and Takaaki Hori and Dogan Can and Xiaodan Zhuang},
journal= {arXiv preprint arXiv:2512.14652},
year = {2025}
}
备注
5 pages, 1 fig