中文

联合语言-音频嵌入是否编码感知音色语义?

声音 2025-10-17 v1 人工智能 音频与语音处理

摘要

理解和建模语言与声音之间的关系对于诸如音乐信息检索、文本引导的音乐生成和音频描述等应用至关重要。这些任务的核心是使用联合语言-音频嵌入空间,将文本描述和听觉内容映射到共享的嵌入空间中。虽然诸如 MS-CLAP、LAION-CLAP 和 MuQ-MuLan 等多模态嵌入模型在对齐语言和音频方面表现出色,但其与人类感知音色语义的对应性仍未得到充分探索。本文评估了上述三个联合语言-音频嵌入模型在捕捉感知音色维度方面的能力。我们的发现表明,LAION-CLAP 在所有乐器声音和音频效果的感知音色语义对齐方面始终提供最可靠的对齐。

关键词

引用

@article{arxiv.2510.14249,
  title  = {Do Joint Language-Audio Embeddings Encode Perceptual Timbre Semantics?},
  author = {Qixin Deng and Bryan Pardo and Thrasyvoulos N Pappas},
  journal= {arXiv preprint arXiv:2510.14249},
  year   = {2025}
}