中文

VocSim:面向单源音频零样本内容一致性的免训练基准

声音 2025-12-12 v1 人工智能

摘要

通用音频表征旨在将同一事件的声学变化实例映射到相近点,在零样本设置下解决内容一致性问题。与通过参数更新衡量适应性的有监督分类基准不同,我们引入了 VocSim,这是一个探测冻结嵌入内在几何对齐的免训练基准。VocSim 汇集了来自 19 个语料库的 12.5 万个单源片段,涵盖人类语音、动物发声和环境声音。通过限制为单源音频,我们将内容表征与源分离的混淆因素隔离开来。我们使用 Precision@k 评估局部纯度,使用全局分离率 (GSR) 评估逐点类别分离。为校准 GSR,我们报告了相对于经验置换基线的提升。在多种基础模型中,一个简单的流程——冻结的 Whisper 编码器特征、时频池化以及无标签 PCA——产生了强大的零样本性能。然而,VocSim 也揭示了一致的泛化差距。在盲测的低资源语音上,局部检索急剧下降。虽然性能在统计上仍可与随机猜测区分,但绝对几何结构发生崩塌,表明未能泛化到未见过的音位配列。作为外部验证,我们的顶级嵌入预测了鸟类感知相似性,改进了生物声学分类,并在 HEAR 基准上取得了最先进的结果。我们认为,此处测量的内在几何质量可作为未列出下游应用中实用性的代理。我们发布了数据、代码和公共排行榜,以标准化内在音频几何的评估。

关键词

引用

@article{arxiv.2512.10120,
  title  = {VocSim: A Training-free Benchmark for Zero-shot Content Identity in Single-source Audio},
  author = {Maris Basha and Anja Zai and Sabine Stoll and Richard Hahnloser},
  journal= {arXiv preprint arXiv:2512.10120},
  year   = {2025}
}