基于预训练音视频文本语音模型的 Cue Speech 生成
计算与语言
2025-01-10 v1
摘要
本文提出了一种用于自动生成 Cue Speech (ACS) 的新方法,Cue Speech 是一种用于听力障碍者以更好地获取语言表达的视觉沟通系统。我们通过利用预训练的音视频自回归文本语音模型 (AVTacotron2) 来探索迁移学习策略。该模型被重新编程,从文本输入推断 Cue Speech (CS) 手势和嘴部动作。在两个公开数据集上进行实验,包括一个专为本研究录制的数据集。使用自动 CS 识别系统评估性能。在声学层面达到约 77% 的解码准确率,结果表明我们方法的有效性。
引用
@article{arxiv.2501.04799,
title = {Cued Speech Generation Leveraging a Pre-trained Audiovisual Text-to-Speech Model},
author = {Sanjana Sankar and Martin Lenglet and Gerard Bailly and Denis Beautemps and Thomas Hueber},
journal= {arXiv preprint arXiv:2501.04799},
year = {2025}
}