应硬编码循环概念还是转而学习它?探索 Transformer 架构用于视听语音识别
音频与语音处理
2020-05-20 v1 机器学习
摘要
视听语音融合策略 AV Align 在具有挑战性的 LRS2 数据集上的视听语音识别 (AVSR) 中展现出显著性能提升。当除听觉模态外还利用语音的视觉模态时,根据噪声水平不同,性能提升幅度在 7% 到 30% 之间。本工作提出 AV Align 的一种变体,其中将循环长短期记忆 (LSTM) 计算块替换为更近期提出的 Transformer 块。我们比较了两种方法,更详细地讨论了它们的优势与弱点。我们发现 Transformer 也能学习跨模态单调对齐,但存在与 LSTM 模型相同的视觉收敛问题,这呼吁对机器学习中主导模态问题展开更深入的研究。
引用
@article{arxiv.2005.09297,
title = {Should we hard-code the recurrence concept or learn it instead ? Exploring the Transformer architecture for Audio-Visual Speech Recognition},
author = {George Sterpu and Christian Saam and Naomi Harte},
journal= {arXiv preprint arXiv:2005.09297},
year = {2020}
}
备注
Submitted to INTERSPEECH 2020