导向深度非线性空间选择性滤波器:用于动态场景中弱引导提取运动说话人的方法
音频与语音处理
2025-05-21 v1 机器学习
声音
摘要
近期使用深度非线性空间滤波器的说话人提取方法在目标方向已知且静止时表现异常出色。然而,由于时变的空间特征和由此产生的模糊性(例如当移动的说话人交叉时),空间动态场景更具挑战性。在静态场景中,用户可能很容易指向目标方向,但手动跟踪移动的说话人是不切实际的。我们不依赖于准确的随时间变化的方向线索(我们称之为强引导),在本文中,我们提出了一种仅依赖目标初始位置的弱引导提取方法,以应对空间动态场景。通过结合我们自己的深度跟踪算法并在合成数据集上开发联合训练策略,我们展示了我们的方法在解决空间模糊性方面的熟练程度,甚至优于不匹配但强引导的提取方法。
引用
@article{arxiv.2505.14517,
title = {Steering Deep Non-Linear Spatially Selective Filters for Weakly Guided Extraction of Moving Speakers in Dynamic Scenarios},
author = {Jakob Kienegger and Timo Gerkmann},
journal= {arXiv preprint arXiv:2505.14517},
year = {2025}
}
备注
Accepted at Interspeech 2025