InSerter:通过无监督交错预训练实现语音指令遵循
声音
2025-06-05 v2 计算与语言
人机交互
音频与语音处理
摘要
语音大语言模型(SpeechLLMs)的最新进展引起了广泛关注。然而,现有方法在遵循语音指令方面表现不佳。值得注意的是,与直接文本形式输入相比,模型在处理语音形式输入时智能性显著降低。先前的研究尝试通过表示和行为对齐等技术来缓解语音与文本表示之间的语义不一致,这涉及在训练后阶段精心设计数据对。在本文中,我们提出了一种简单且可扩展的训练方法 InSerter,即交错语音-文本表示预训练(Interleaved Speech-Text Representation Pre-training)。InSerter 旨在预训练大规模无监督语音-文本序列,其中语音是通过文本转语音转换从广泛文本语料库中随机选择的片段合成的。因此,模型获得了为提供的语音片段生成文本续接的能力,无需进行密集的数据设计工作。为了系统评估语音指令遵循能力,我们引入了 SpeechInstructBench,这是首个专门针对语音导向指令遵循任务的综合性基准。我们提出的 InSerter 在 SpeechInstructBench 上取得了 SOTA 性能,并在多样化的语音处理任务中展示了优越或具有竞争力的结果。
引用
@article{arxiv.2503.02769,
title = {InSerter: Speech Instruction Following with Unsupervised Interleaved Pre-training},
author = {Dingdong Wang and Jin Xu and Ruihang Chu and Zhifang Guo and Xiong Wang and Jincenzi Wu and Dongchao Yang and Shengpeng Ji and Junyang Lin},
journal= {arXiv preprint arXiv:2503.02769},
year = {2025}
}
备注
Accepted to ACL 2025; Data is available at: https://huggingface.co/datasets/ddwang2000/SpeechInstructBench