UNMIXX:解缠高度相关的歌声混合
声音
2026-01-21 v1 音频与语音处理
摘要
我们提出了UNMIXX,一个用于多歌声分离(MSVS)的新框架。虽然与语音分离相关,但MSVS面临独特的挑战:数据稀缺和歌声混合的高度相关性。为了解决这些问题,我们提出了包含三个关键组件的UNMIXX:(1) 基于音乐知识的混合策略,用于构建高度相关、类似音乐的混合信号;(2) 跨源注意力,通过反向注意力将两个歌手的表征分离;(3) 幅度惩罚损失,惩罚错误分配的干扰能量。UNMIXX不仅通过模拟逼真的训练数据解决了数据稀缺问题,还通过架构和损失层面的跨源交互,擅长分离高度相关的混合信号。我们的大量实验表明,UNMIXX显著提升了性能,SDRi增益比先前工作高出2.2 dB以上。
引用
@article{arxiv.2601.12802,
title = {UNMIXX: Untangling Highly Correlated Singing Voices Mixtures},
author = {Jihoo Jung and Ji-Hoon Kim and Doyeop Kwak and Junwon Lee and Juhan Nam and Joon Son Chung},
journal= {arXiv preprint arXiv:2601.12802},
year = {2026}
}
备注
Accepted by ICASSP 2026