基于时长感知注意力网络的京剧唱腔合成
音频与语音处理
2020-08-10 v1 计算与语言
声音
摘要
京剧自约两百年前起一直是中国表演艺术中最具主导性的形式。京剧演员通常通过引入即兴发挥与表现力在舞台上展现出极强的个人风格,这使得实际节奏与音高轮廓显著偏离原始曲谱。这种不一致性给从曲谱进行京剧唱腔合成带来了巨大挑战。在本工作中,我们提出处理该问题,并基于时长感知注意力网络(Duration Informed Attention Network, DurIAN)框架从曲谱合成富有表现力的京剧唱腔。为应对节奏失配,采用拉格朗日乘子法在给定曲谱音符时长的约束下寻找最优输出音素时长序列。至于音高轮廓失配,我们不直接从曲谱推断,而是采用由真实唱腔生成的伪曲谱并在训练时作为输入馈入。实验表明,所提系统能够合成具有高质量音色、音高与表现力的京剧唱腔。
引用
@article{arxiv.2008.03029,
title = {Peking Opera Synthesis via Duration Informed Attention Network},
author = {Yusong Wu and Shengchen Li and Chengzhu Yu and Heng Lu and Chao Weng and Liqiang Zhang and Dong Yu},
journal= {arXiv preprint arXiv:2008.03029},
year = {2020}
}
备注
Accepted by INTERSPEECH 2020