通过查询重写发掘语音指令数据潜力
人工智能
2025-07-14 v1 声音
音频与语音处理
摘要
端到端的大型语音语言模型(Large Speech Language Models, LSLMs)在响应延迟和语音理解能力方面展现出强大的潜力,展示了跨越语音理解任务的通用智能。然而,跟随语音指令的能力尚未完全实现,主要由于数据集缺乏和训练任务偏差。利用丰富的语音识别数据集,之前的做法是使用大型语言模型(Large Language Models, LLMs)继续语音的语言信息,以构建语音指令数据集。然而,由于LLM生成结果与真实人类响应之间存在差距,继续方法进一步放大了这些短comings。鉴于通过人工收集和标注语音指令数据集的高成本,使用语音合成构建大规模语音指令数据集已成为一种平衡且稳健的替代方案。虽然现代文本到语音(Text-To-Speech, TTS)模型已实现接近人类水平的合成质量,但在将分布之外的文本指令合成为语音时仍具挑战性,这源于TTS模型训练数据分布的局限性。为此,我们提出了一种基于多LLM知识融合的查询重写框架,采用多个代理进行合成语音的标注和验证,使得无需依赖人工标注即可构建高质量语音指令数据集成为可能。实验表明,该方法通过零样本重写将文本指令转换为更适用于TTS模型进行语音合成的分布,数据可用性从72%提升至93%。它在需要复杂知识和上下文相关能力的重写任务中也展现出独特优势。
引用
@article{arxiv.2507.08603,
title = {Unlocking Speech Instruction Data Potential with Query Rewriting},
author = {Yonghua Hei and Yibo Yan and Shuliang Liu and Huiyu Zhou and Linfeng Zhang and Xuming Hu},
journal= {arXiv preprint arXiv:2507.08603},
year = {2025}
}
备注
ACL 2025 Findings