中文

Soundwave:面向LLM语音-文本对齐的高效方法

计算与语言 2025-02-19 v1 人工智能 声音

摘要

现有的端到端语音大语言模型(LLM)通常依赖大规模标注数据进行训练,而数据效率训练尚未得到深入探讨。我们聚焦于语音与文本之间的两个根本问题:表示空间差距和序列长度不一致问题。我们提出 Soundwave,利用高效训练策略和新颖架构来解决上述问题。结果表明,Soundwave 在语音翻译和 AIR-Bench 语音任务中超越了先进的 Qwen2-Audio,仅使用了训练数据的十分之一。进一步分析显示,Soundwave 在对话中仍保持其智能性。该项目已公开于 https://github.com/FreedomIntelligence/Soundwave。

关键词

引用

@article{arxiv.2502.12900,
  title  = {Soundwave: Less is More for Speech-Text Alignment in LLMs},
  author = {Yuhao Zhang and Zhiheng Liu and Fan Bu and Ruiyu Zhang and Benyou Wang and Haizhou Li},
  journal= {arXiv preprint arXiv:2502.12900},
  year   = {2025}
}