Speech-XL:面向大型语音语言模型的长时段语音理解
声音
2026-02-06 v1
摘要
尽管大型语音语言模型(Large Speech Language Models, LSLMs)在处理短时声学信号方面取得了显著进展,但其在长时段音频理解上的扩展仍严重受制于上下文长度限制和推理时的高额内存占用。为此,本文提出了 Speech-XL—a 新型模型,利用大型语言模型(Large Language Models, LLMs)内在的键值稀疏化能力,实现高比例的语音输入压缩。具体而言,我们引入一种新型特殊标记——语音总结标记(Speech Summarization Token, SST),用于每个语音区间,将区间内的语音信息封装至其关联的键值对中。SST 模块通过指令微调进行训练,采用课程学习策略,使 SST 能够逐步压缩信息——从低比例(简单)到高比例(具有挑战性)的压缩。尽管训练数据显著少于其他基线方法,本模型在主要基准(包括 LongSpeech 和 AUDIOMARATHON)上实现了高度具竞争力的性能。通过解决长时段音频建模中的长期瓶颈,我们的方法为音频序列的压缩提供了新的视角。
引用
@article{arxiv.2602.05373,
title = {Speech-XL: Towards Long-Form Speech Understanding in Large Speech Language Models},
author = {Haoqin Sun and Chenyang Lyu and Shiwan Zhao and Xuanfan Ni and Xiangyu Kong and Longyue Wang and Weihua Luo and Yong Qin},
journal= {arXiv preprint arXiv:2602.05373},
year = {2026}
}