面对音乐:电影音频源分离中的歌唱声分离
音频与语音处理
2024-08-27 v2 人工智能
机器学习
声音
摘要
电影音频源分离(CASS)作为从混合信号中提取独立声轨的独立问题,是音频源分离的一个较新的子任务。CASS的典型设置是一个三声轨问题,目标是将混合信号分离为对话(DX)、音乐(MX)和音效(FX)声轨。然而,考虑到电影声音制作的创作性质,存在若干边缘情况;某些声源无法整齐地归入这三个声轨中的任何一个,因此在制作中需要使用额外的辅助声轨。一个非常常见的边缘情况是电影音频中的歌唱声,根据电影语境的不同,它可能属于DX或MX,也可能不属于其中任何一个。在这项工作中,我们展示了将专用的解码器Bandit模型和基于查询的单解码器Banquet模型扩展到四声轨问题的非常直接的方法,将非音乐对话、器乐、歌唱声和音效作为独立的声轨。有趣的是,基于查询的Banquet模型优于专用的解码器Bandit模型。我们假设这是由于带无关的FiLM层在瓶颈处施加了更好的特征对齐。数据集和模型实现将在https://github.com/kwatcharasupat/source-separation-landing上公开。
引用
@article{arxiv.2408.03588,
title = {Facing the Music: Tackling Singing Voice Separation in Cinematic Audio Source Separation},
author = {Karn N. Watcharasupat and Chih-Wei Wu and Iroro Orife},
journal= {arXiv preprint arXiv:2408.03588},
year = {2024}
}
备注
Submitted to the Late-Breaking Demo Session of the 25th International Society for Music Information Retrieval (ISMIR) Conference, 2024