VOX-KRIKRI:通过连续融合统一语音与语言
计算与语言
2025-09-22 v1 声音
音频与语音处理
摘要
我们提出一种多模态融合框架,旨在连接基于预训练解码器的大型语言模型(LLM)和声学编码器-解码器架构如Whisper,构建具备语音能力的LLM。我们不直接使用音频嵌入,而是探索一种更有效的对齐机制——基于连续音频条件文本空间。该方法完全在连续文本表示空间中运行,通过跨模态注意力融合Whisper的隐藏解码器状态与LLM的隐藏状态,支持离线和流式模式。我们引入了\textit{VoxKrikri},第一个希腊语语音LLM,经过分析显示我们的方法有效地实现了跨模态表示的对齐。这些结果表明,连续空间融合是实现多语言和低资源语音LLM的有前景的路径,同时在希腊语自动语音识别中实现了最先进的成绩,基准测试中平均实现约20%的相对改进。
引用
@article{arxiv.2509.15667,
title = {VOX-KRIKRI: Unifying Speech and Language through Continuous Fusion},
author = {Dimitrios Damianos and Leon Voukoutis and Georgios Paraskevopoulos and Vassilis Katsouros},
journal= {arXiv preprint arXiv:2509.15667},
year = {2025}
}