SynTTS-Commands:面向设备端 KWS 的 TTS 合成多语言语音数据集
声音
2025-11-25 v2
摘要
高性能、面向超低功耗硬件的设备端关键词检测 (KWS) 系统的开发在专业多命令训练数据集的稀缺性方面面临严峻挑战。传统数据收集通过人工录音, 成本高、缓慢且缺乏可扩展性。本文引入 SYNTTS-COMMANDS, 一个新型、多语言语音命令数据集, 完全由基于最先进文本转语音 (TTS) 合成生成。我们利用 CosyVoice 2 模型和来自公共语料库的说话人嵌入, 创建了由英文和中文命令构成的可扩展集合。对各类高效声学模型进行大规模基准测试表明, 我们合成的数据集可实现极高准确率, 在英文命令识别上达到最高 99.5%, 在中文命令识别上达到 98%。这些结果强有力地验证了合成语音能有效替代人工录制音频用于训练 KWS 分类器。我们的工作直接解决了 TinyML 中的数据瓶颈, 为构建私有、低延迟和高效能的语音接口提供了实用、可扩展的基础。数据集和源代码已公开于 https://github.com/lugan113/SynTTS-Commands-Official。
引用
@article{arxiv.2511.07821,
title = {SynTTS-Commands: A Public Dataset for On-Device KWS via TTS-Synthesized Multilingual Speech},
author = {Lu Gan and Xi Li},
journal= {arXiv preprint arXiv:2511.07821},
year = {2025}
}