用于 Cue Speech 识别的计算与参数高效的多模态融合 Transformer
计算机视觉与模式识别
2024-02-09 v2 声音
音频与语音处理
摘要
Cued Speech (CS) 是听障人士使用的一种纯视觉编码方法,它将唇读与几种特定的手形相结合,使口语变得可见。自动 CS 识别 (ACSR) 旨在将语音的视觉线索转录为文本,这可以帮助听障人士进行有效沟通。CS 的视觉信息包含唇读和手势提示,因此两者的融合在 ACSR 中起着重要作用。然而,以往大多数融合方法难以捕捉多模态 CS 数据长序列输入中存在的全局依赖关系。因此,这些方法通常无法学习到有助于融合的有效跨模态关系。最近,基于注意力的 Transformer 已成为在多模态融合中捕捉长序列全局依赖关系的普遍思路,但现有的多模态融合 Transformer 在 ACSR 任务中存在识别准确率差和计算效率低的问题。为了解决这些问题,我们通过提出一种新颖的 Token 重要性感知注意力机制 (TIAA),开发了一种计算与参数高效的多模态融合 Transformer,其中制定了 Token 利用率 (TUR) 以从多模态流中选择重要的 Token。更准确地说,TIAA 首先对每种模态的所有 Token 建模特定模态的细粒度时间依赖关系,然后在不同模态的重要 Token 上学习模态共享的粗粒度时间依赖关系的高效跨模态交互。此外,设计了一个轻量级的门控隐藏投影来控制 TIAA 的特征流。由此产生的模型名为 Economical Cued Speech Fusion Transformer (EcoCued),与现有的基于 Transformer 的融合方法和 ACSR 融合方法相比,在所有现有的 CS 数据集上均取得了 state-of-the-art 的性能。
引用
@article{arxiv.2401.17604,
title = {Computation and Parameter Efficient Multi-Modal Fusion Transformer for Cued Speech Recognition},
author = {Lei Liu and Li Liu and Haizhou Li},
journal= {arXiv preprint arXiv:2401.17604},
year = {2024}
}
备注
Accepted by TASLP