中文

通过嵌入有效秩统一神经比例定律中的变量——面向通用音频表征

声音 2025-10-14 v1 人工智能 音频与语音处理

摘要

比例定律在计算机视觉和自然语言处理领域深刻影响了我们对模型性能的理解,但其在通用音频表征学习中的应用仍受到忽视。一个关键挑战在于,通用音频表征具有多因素特性——表征质量受音频长度、嵌入维度、模型深度、模型架构、数据量等变量的共同影响,且许多变量难以孤立或解析表达。本文通过利用嵌入有效秩(RankMe)作为统一度量指标,系统研究了通用音频表征的比例定律。RankMe实现了对音频嵌入的无标签、信息论量化,使我们能够横跨广泛的超参数空间检验比例行为,包括模型规模、训练数据量、计算预算、架构配置等。我们的实证发现,RankMe与表征质量之间存在一致的幂律关系,表明嵌入有效秩是评估和预测音频表征学习中模型性能可靠的代理指标。这一工作不仅验证了经典比例原理在通用音频领域的适用性,还为在音频基础模型中指导未来模型比例策略提供了理论依据和实证支撑。

关键词

引用

@article{arxiv.2510.10948,
  title  = {Unify Variables in Neural Scaling Laws for General Audio Representations via Embedding Effective Rank},
  author = {Xuyao Deng and Yanjie Sun and Yong Dou and Kele Xu},
  journal= {arXiv preprint arXiv:2510.10948},
  year   = {2025}
}