Cryfish:使用大语言模型进行深度音频分析
音频与语音处理
2025-08-19 v1
摘要
近期在基于文本的大型语言模型(LLM)方面的革命性进展推动了将此类模型的能力扩展到多模态感知和理解任务的兴趣增长。听觉是一种高度希望集成到LLM中的关键能力。然而,将聆听能力有效地集成到LLM中是一个显著的挑战,关键在于跨语音和声音的复杂听觉任务的泛化。为此,我们介绍了Cryfish——我们版本的具备听觉能力的LLM。该模型将WavLM音频编码器特征集成到Qwen2模型中,采用基于转换器的连接器。Cryfish通过一种专门的训练策略适应各种听觉任务。我们在专为具备听觉能力的模型设计的新型Dynamic SUPERB Phase-2综合多任务基准测试中对模型进行评估。该论文对Cryfish与公开模型的深入分析和详细比较。
引用
@article{arxiv.2508.12666,
title = {Cryfish: On deep audio analysis with Large Language Models},
author = {Anton Mitrofanov and Sergei Novoselov and Tatiana Prisyach and Vladislav Marchevskiy and Arseniy Karelin and Nikita Khmelev and Dmitry Dutov and Stepan Malykh and Igor Agafonov and Aleksandr Nikitin and Oleg Petrov},
journal= {arXiv preprint arXiv:2508.12666},
year = {2025}
}