通过多通道注意力判别器实现说话人无关的声学-发音反演
信号处理
2024-06-26 v1 声音
音频与语音处理
生物物理
摘要
我们提出了一种新颖的说话人无关的声学-发音反演模型,克服了依赖于从受限数据集导出的声学特征的传统AAI模型的局限性。为了应对这些挑战,我们利用来自预训练自监督学习模型的表示,在AAI过程中更有效地估计电磁发音描记信号中的全局、局部和运动模式信息。我们使用对抗方法训练我们的模型,并引入了一个基于注意力的多时长音素判别器,旨在充分捕捉多通道发音信号之间复杂的关系。我们的方法达到了0.847的皮尔逊相关系数,标志着在说话人无关的AAI模型中达到了最先进的性能。实现细节和代码可以在线获取。
引用
@article{arxiv.2406.17329,
title = {Speaker-Independent Acoustic-to-Articulatory Inversion through Multi-Channel Attention Discriminator},
author = {Woo-Jin Chung and Hong-Goo Kang},
journal= {arXiv preprint arXiv:2406.17329},
year = {2024}
}
备注
Accepted to INTERSPEECH 2024