中文

基于置信度加权的跨注意力多通道音频对齐

声音 2025-09-23 v1 人工智能 机器学习 音频与语音处理

摘要

多通道音频对齐是生物声学监测、空间音频系统和声学定位中的关键需求。然而,现有方法常常难以解决非线性时钟漂移问题,缺乏不确定性量化机制。传统方法如交叉相关和动态时间归形假设简单的时间漂移模式,且不提供可靠性措施。而近期深度学习模型通常将对齐任务视为二元分类任务,忽略了通道间的依赖关系和不确定性估计。我们引入一种方法,结合跨注意力机制和置信度加权评计,以提高多通道音频同步性能。我们将 BEATs 编码器扩展引入跨注意力层,以建模通道之间的时序关系。我们还开发了一种置信度加权评计函数,该函数使用完整的预测分布而非二元阈值。本方法在 BioDCASE 2025 Task 1 挑战中取得第一名,测试数据集上的平均 MSE 为 0.30,优于深度学习基线的 0.58。在单个数据集上,我们在 ARU 数据上实现 0.14 的 MSE(降低 77%),在鸟类数据上实现 0.45 的 MSE(降低 18%)。该框架支持概率性时序对齐,超越点估计。虽然在生物声学语境中进行了验证,但该方法同样适用于对齐置信度至关重要的更广泛多通道音频任务。代码已公开:https://github.com/Ragib-Amin-Nihal/BEATsCA

关键词

引用

@article{arxiv.2509.16926,
  title  = {Cross-Attention with Confidence Weighting for Multi-Channel Audio Alignment},
  author = {Ragib Amin Nihal and Benjamin Yen and Takeshi Ashizawa and Kazuhiro Nakadai},
  journal= {arXiv preprint arXiv:2509.16926},
  year   = {2025}
}

备注

Accepted on Workshop on Detection and Classification of Acoustic Scenes and Events (DCASE 2025)