基于半自动方法的印地语韵律标注数据集
强关联电子
2022-07-15 v2
摘要
本研究旨在开发一个半自动标注的印地语韵律数据库,以增强ASR和TTS系统中的语调组件,这也有助于构建语音到语音机器翻译系统。尽管印地语中不存在单一的韵律标注标准,但过去的研究人员已在文献中采用感知和统计方法来推断印地语韵律模式的行为。基于此类现有研究及被广泛认同的印地语语调理论,本研究尝试首先开发一个手动标注的印地语语音数据韵律语料库,随后将其用于训练预测模型以生成自动韵律标签。共计标注了5000个句子(23500个词),涵盖陈述句和疑问句类型。所训练模型在音高重音、中间短语边界和重音短语边界上的准确率分别为73.40%、93.20%和43%。
引用
@article{arxiv.2112.05972,
title = {Antiferromagnetic ordering of organic Mott insulator $\lambda$-(BEDSe-TTF)$_2$GaCl$_4$},
author = {A. Ito and T. Kobayashi and D. P. Sari and I. Watanabe and Y. Saito and A. Kawamoto and H. Tsunakawa and K. Satoh and H. Taniguchi},
journal= {arXiv preprint arXiv:2112.05972},
year = {2022}
}
备注
12 pages, 9 figures, accepted for publication in Phys. Rev. B