用于突显词检测的声学参数 CNN 编码
计算与语言
2022-01-31 v3 声音
音频与语音处理
摘要
表达性朗读被视为口语阅读流畅性的决定性属性,包含短语和突显的韵律实现。在口语阅读评估中,它有助于确定说话者对文本的理解。我们考虑一个带标注的儿童阅读录音数据集,利用声学-韵律和词汇-句法特征进行说话人无关的突显词检测。先前调优良好的随机森林集成预测器被 RNN 序列分类器取代,以利用较长话语中潜在的上下文依赖。此外,应用深度学习以端到端方式从基频、强度和谱形的低层声学轮廓中获取词级特征。给出了不同特征类型与不同特征学习架构在突显词预测上的性能比较,以尽可能得出见解。
引用
@article{arxiv.2104.05488,
title = {CNN Encoding of Acoustic Parameters for Prominence Detection},
author = {Kamini Sabu and Mithilesh Vaidya and Preeti Rao},
journal= {arXiv preprint arXiv:2104.05488},
year = {2022}
}
备注
5 pages, 2 figures, 6 tables, Submitted to INTERSPEECH 2021