基于唤醒的注册:面向真实噪声人机对话场景的目标语音提取第一项比较研究
音频与语音处理
2026-02-25 v2 声音
摘要
目标语音提取(TSE)通常依赖预录制的高质量注册语音,这会 disrupt 用户体验并限制在自发互动中的可行性。本文提出Enroll-on-Wakeup(EoW),一种新型框架,其中在人机互动期间自然捕获的唤醒词片段自动用作注册参考。这消除了对预收集语音的需求,以实现无缝体验。我们进行了对EoW-TSE的首项系统性研究,在真实多样的声学条件下评估了先进的判别和生成模型。鉴于唤醒片段的短小和嘈杂,我们研究了基于LLM的TTS enrollment增强。结果表明,尽管当前TSE模型在EoW-TSE中面临性能下降,TTS基于辅助显著增强了听觉体验,尽管在语音识别准确率方面仍存在差距。
引用
@article{arxiv.2602.15519,
title = {Enroll-on-Wakeup: A First Comparative Study of Target Speech Extraction for Seamless Interaction in Real Noisy Human-Machine Dialogue Scenarios},
author = {Yiming Yang and Guangyong Wang and Haixin Guan and Yanhua Long},
journal= {arXiv preprint arXiv:2602.15519},
year = {2026}
}
备注
This paper is submitted to Interspeech 2026