ConcateNet:基于局部与全局特征拼接的对话分离
音频与语音处理
2024-08-19 v1 计算与语言
声音
摘要
对话分离旨在从混合信号(如电影或电视节目)中分离出对话信号。这可能是实现广播相关应用对话增强的必要步骤。本文提出了用于对话分离的 ConcateNet,其基于一种处理局部与全局特征的新方法,旨在更好地泛化至域外信号。ConcateNet 使用一个以降噪为导向的公开数据集进行训练,并在三个数据集上进行评估:两个以降噪为导向的数据集(域内),其中 ConcateNet 展现出具有竞争力的性能;以及一个以广播为导向的数据集(域外),验证了所提架构相较于已有先进降噪方法具有更好的泛化性能。
引用
@article{arxiv.2408.08729,
title = {ConcateNet: Dialogue Separation Using Local And Global Feature Concatenation},
author = {Mhd Modar Halimeh and Matteo Torcoli and Emanuël Habets},
journal= {arXiv preprint arXiv:2408.08729},
year = {2024}
}