用于不流畅语音转写与检测的无约束不流畅性建模
音频与语音处理
2023-12-21 v1 声音
摘要
不流畅语音建模需要在词级和音素级上进行时间精确且感知静默的转写。然而,当前的不流畅性建模研究主要专注于转写或检测中的某一方面,且各方面的性能仍然有限。在本工作中,我们提出了一种无约束不流畅性建模(UDM)方法,以自动且分层的方式同时解决转写和检测问题。UDM 通过提供全面的解决方案,消除了对大量人工标注的需求。此外,我们引入了一个名为 VCTK++ 的模拟不流畅数据集,以增强 UDM 在音素转写方面的能力。实验结果证明了我们所提方法在转写和检测任务中的有效性与鲁棒性。
引用
@article{arxiv.2312.12810,
title = {Unconstrained Dysfluency Modeling for Dysfluent Speech Transcription and Detection},
author = {Jiachen Lian and Carly Feng and Naasir Farooqi and Steve Li and Anshul Kashyap and Cheol Jun Cho and Peter Wu and Robbie Netzorg and Tingle Li and Gopala Krishna Anumanchipalli},
journal= {arXiv preprint arXiv:2312.12810},
year = {2023}
}
备注
2023 ASRU