中文

通过 articulatory 控制教会机器人说话

音频与语音处理 2025-10-08 v1

摘要

当前 speech production 系统主要依赖大规模 transformer 模型,这类模型作为黑盒运作,提供的解释性和对人类语音物理机制的 grounding 极少。我们通过提出新的框架:通过显式 articulatory 控制进行 speech generation 来解决这一限制。这将语音reframed为类似机器人操作的 motor control 任务。我们的approach使用强化学习训练一个 policy,直接控制声道 articulators(如舌头、唇和下颌)的运动,以产生 syllable 级别的语音。具体而言,我们采用 Proximal Policy Optimization 算法,基于由音频感知器 Sylber 提供的 acoustic feedback 来学习最优 articulatory 运动。生成的 articulatory trajectories 通过预训练的 articulatory-to-speech 解码器 SPARC 解码为 audio。我们在六个目标 syllable 上训练该框架,结果显示该框架成功收敛,policy 生成的 audio 与目标 syllable 的 similarity 分数超过 0.85。对语音中如 "please"、"loot" 和 "cat" 等 syllable 进行准确的人类转录,表明该框架具有良好的可理解性。

关键词

引用

@article{arxiv.2510.05619,
  title  = {Teaching Machines to Speak Using Articulatory Control},
  author = {Akshay Anand and Chenxu Guo and Cheol Jun Cho and Jiachen Lian and Gopala Anumanchipalli},
  journal= {arXiv preprint arXiv:2510.05619},
  year   = {2025}
}