重制分离与重制:多语言电影音频源分离数据集
音频与语音处理
2024-08-27 v2 计算与语言
机器学习
声音
摘要
电影音频源分离 (CASS) 通过从混合音频中提取对话、音乐和效果等独立轨道,成为一种新兴的音频源分离子任务。目前仅存在一个公开数据集用于 CASS,即 Divide and Remaster (DnR) 数据集,当前版本为 v2。尽管 DnR v2 已是 CASS 领域极其有用的资源,但仍存在若干改进空间,尤其在其被用于 2023 年声音混合挑战赛期间暴露了这些问题。本文开发了 DnR 数据集的 v3 版本,解决了关于非对话轨道中人声内容、响度分布、制作流程以及语言多样性等问题。具体而言,DnR v3 的对话轨道包含来自超过 30 种语言的语音内容,涵盖德语族、罗马语族、印度语族、达利语族、马来-波利尼西亚语族和班图语族等多个语言家族。使用 Bandit 模型进行基准测试表明,基于多语言数据的训练可显著提升模型对数据稀缺语言的泛化能力。即便在数据丰富的语言上,多语言模型也常常在准确率上与仅在单语 CASS 数据集上训练的专用模型持平或更好。数据集和模型实现将在 https://github.com/kwatcharasupat/source-separation-landing 上公开。
引用
@article{arxiv.2407.07275,
title = {Remastering Divide and Remaster: A Cinematic Audio Source Separation Dataset with Multilingual Support},
author = {Karn N. Watcharasupat and Chih-Wei Wu and Iroro Orife},
journal= {arXiv preprint arXiv:2407.07275},
year = {2024}
}
备注
Accepted to the 5th IEEE International Symposium on the Internet of Sounds. Camera-ready version