MM-ALT:一种多模态自动歌词转写系统
音频与语音处理
2023-02-20 v3 声音
信号处理
摘要
自动歌词转写(ALT)是一个新兴的研究领域,因其重要的应用潜力而日益受到语音与音乐信息检索社区的关注。然而,仅依靠音频数据的 ALT 是一项众所周知的困难任务,因为乐器伴奏与音乐约束导致演唱歌词的语音线索与可懂度均下降。为应对这一挑战,我们提出了多模态自动歌词转写系统(MM-ALT),并构建了一个新数据集 N20EM,其包含音频录音、唇部运动视频以及演唱者所戴耳塞的惯性测量单元(IMU)数据。我们首先将自动语音识别(ASR)中的 wav2vec 2.0 框架适配到 ALT 任务。随后提出一种基于视频的 ALT 方法与一种基于 IMU 的语音活动检测(VAD)方法。此外,我们提出残差交叉注意力(RCA)机制以融合三种模态(即音频、视频与 IMU)的数据。实验表明了我们所提 MM-ALT 系统的有效性,尤其在噪声鲁棒性方面。项目页面位于 https://n20em.github.io。
引用
@article{arxiv.2207.06127,
title = {MM-ALT: A Multimodal Automatic Lyric Transcription System},
author = {Xiangming Gu and Longshen Ou and Danielle Ong and Ye Wang},
journal= {arXiv preprint arXiv:2207.06127},
year = {2023}
}
备注
Accepted by ACM Multimedia 2022. Camera ready version and appendix