无文本条件下的音素-音频对齐:一种半监督方法
计算与语言
2022-02-07 v2 声音
音频与语音处理
摘要
音素-音频对齐任务在语音研究中有诸多应用。本文介绍两种基于 Wav2Vec2 的模型,分别用于文本相关与文本无关的音素-音频对齐。所提出的半监督模型 Wav2Vec2-FS 通过对比学习和前向求和损失直接学习音素-音频对齐,并可耦合预训练音素识别器以实现文本无关对齐。另一模型 Wav2Vec2-FC 是在强制对齐标签上训练的帧分类模型,既能执行强制对齐也可进行文本无关分割。评估结果表明,即便在无转录文本可用时,两种所提方法生成的结果与现有强制对齐工具高度接近。我们的工作提出了一种全自动化音素-音频对齐的神经流程。代码与预训练模型见 https://github.com/lingjzhu/charsiu。
引用
@article{arxiv.2110.03876,
title = {Phone-to-audio alignment without text: A Semi-supervised Approach},
author = {Jian Zhu and Cong Zhang and David Jurgens},
journal= {arXiv preprint arXiv:2110.03876},
year = {2022}
}
备注
ICASSP 2022