中文

通过数据驱动方法发现音素特异性关键摆臂

音频与语音处理 2025-05-02 v1

摘要

我们提出了一种通过机器学习方法学习音素关键摆臱的思路。我们将学习过程建模为三个端到端训练的模型。首先,我们使用声学到摆臂反演(Acoustic to Articulatory Inversion, AAI)来预测时间变化的语音摆臂 EMA。我们还预测每个帧中摆臂的音素特定权重。为避免过拟合,我们在权重预测层之前添加了一个 dropout 层。接下来,我们对预测的摆臂权重进行归一化处理,使用每个帧的最小-最大归一化方法。归一化后的权重乘以真实的 EMA,然后我们尝试预测每个帧的语音phone。我们采用端到端方式进行训练,使用两种损失函数:一种是用于语音预测的交叉熵损失,另一种是用于 AAI 预测的均方误差损失。为保持语音预测模块与 EMA 预测模块之间的梯度流动,我们使用直梯度估计(straight-through estimation)。本研究的目标是在端到端训练模型的同时,预测每个帧的摆臱权重。

关键词

引用

@article{arxiv.2505.00007,
  title  = {Discovering phoneme-specific critical articulators through a data-driven approach},
  author = {Jesuraj Bandekar and Sathvik Udupa and Prasanta Kumar Ghosh},
  journal= {arXiv preprint arXiv:2505.00007},
  year   = {2025}
}