利用预训练视听文本转语音模型生成 Cued Speech
高能天体物理现象
2025-01-10 v1
摘要
本文提出了一种自动生成 Cued Speech (ACSG) 的新方法,Cued Speech 是一种供听障人士使用的视觉交流系统,旨在更好地辅助其理解口语。我们通过利用预训练的视听自回归文本转语音模型 (AVTacotron2) 探索了迁移学习策略。该模型被重新编程,以根据文本输入推断 Cued Speech (CS) 的手部与唇部运动。实验在两个公开可用的数据集上进行,其中一个专门为本研究所录制。性能评估使用自动 CS 识别系统完成。在音位级别的解码准确率达到约 77% 的情况下,结果证明了我们方法的有效性。
引用
@article{arxiv.2501.04800,
title = {Effective resistivity in relativistic reconnection: a prescription based on fully kinetic simulations},
author = {Abigail Moran and Lorenzo Sironi and Aviad Levis and Bart Ripperda and Elias R. Most and Sebastiaan Selvi},
journal= {arXiv preprint arXiv:2501.04800},
year = {2025}
}