一种基于音符级对比聚类的轻量级双分支多乐器转录架构
声音
2026-04-17 v5 信息检索
摘要
现有多音色转录模型难以泛化到预训练乐器之外,受限于严格的声源数量约束,且计算需求高,阻碍了在低资源设备上的部署。我们通过一个轻量级模型来解决这些局限,该模型在音色无关的转录主干上扩展了一个专用的音色编码器,并在音符级别执行深度聚类,从而在给定乐器类别数量的情况下,实现对任意乐器的联合转录与动态分离。包括谱归一化、空洞卷积和对比聚类在内的实用优化进一步提高了效率和鲁棒性。尽管模型尺寸小、推理速度快,其在转录准确性和分离质量方面仍达到了与更重量级基线模型相当的性能,并展现出良好的泛化能力,使其非常适合在现实世界和资源受限的实际环境中部署。
引用
@article{arxiv.2509.12712,
title = {A Lightweight Two-Branch Architecture for Multi-Instrument Transcription via Note-Level Contrastive Clustering},
author = {Ruigang Li and Yongxu Zhu},
journal= {arXiv preprint arXiv:2509.12712},
year = {2026}
}
备注
Published in TISMIR, Vol. 9, No. 1, pp. 119-130, 2026