KunquDB:面向中文歌仙戏场景的说话人验证
音频与语音处理
2024-08-22 v2 声音
图像与视频处理
摘要
本工作旨在促进中文歌仙戏研究在音乐和语音领域的进展,主要关注克服数据限制问题。我们引入KunquDB,一个规模相对较大且标注完善的音视频数据集,包含339位说话人和128小时的内容。KunquDB源自《昆曲艺术全书》, meticulously structured by dialogue lines,提供明确的标注,包括角色姓名、说话人姓名、性别信息、声乐方式分类,以及初步的文本转录。KunquDB为角色中心的声学研究和语音相关研究提供了多样化的基础,包括自动说话人验证(ASV)。除了丰富歌仙戏研究之外,该数据集还促进了艺术表达与技术创新之间的鸿沟。我们首次探索ASV在中文歌仙戏中的应用,构建了四个测试方案,考虑歌仙戏语音中两种不同的声乐方式:stage speech(剧场演讲)和singing(演唱)。通过实施域适应方法有效缓解了这些声乐方式差异导致的域不匹配问题,尽管仍有进一步改进的空间。
引用
@article{arxiv.2403.13356,
title = {KunquDB: An Attempt for Speaker Verification in the Chinese Opera Scenario},
author = {Huali Zhou and Yuke Lin and Dong Liu and Ming Li},
journal= {arXiv preprint arXiv:2403.13356},
year = {2024}
}
备注
Accepted by ICPR 2024