AVFSNet:面向灵活说话人数的音视频语音分离 with 多尺度与多任务学习
音频与语音处理
2025-07-18 v1 声音
摘要
从混合信号中分离目标语音包含灵活说话人数量,是一个具有挑战性的任务。虽然现有方法显示出强大的分离性能和鲁棒性,但它们主要假设说话人数量已知。针对未知说话人数量情景的有限研究显示出在实际声学环境中受限的泛化能力。为克服这些挑战,本文提出 AVFSNet -- 一个集成多尺度编码和并行架构的音视频语音分离模型,联合优化说话人计数和多说话人分离任务。该模型在并行中独立分离每个说话人,同时通过集成视觉信息增强环境噪声适应性。全面的实验评估表明,AVFSNet 在多个评估指标上实现了最新的结果,并在多样化数据集上提供了卓越的性能。
引用
@article{arxiv.2507.12972,
title = {AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning},
author = {Daning Zhang and Ying Wei},
journal= {arXiv preprint arXiv:2507.12972},
year = {2025}
}