ASoBO: 用于会议远场说话人日志的注意力波束选择
声音
2024-06-06 v1 人工智能
音频与语音处理
摘要
说话人日志(SD)旨在将属于同一说话人的语音片段分组。该任务在许多语音处理应用中是必需的,例如丰富的会议转录。在此背景下,远场麦克风阵列通常用于捕获音频信号。波束成形,即空间滤波,是处理多麦克风音频数据的常见做法。然而,它通常需要明确定位活动声源以引导滤波器。本文提出了一种基于自注意力的算法来选择一组固定空间滤波器的输出。该方法作为联合语音活动检测(VAD)和重叠语音检测(OSD)的特征提取器。然后从检测到的片段推断出说话人日志。该方法在远场VAD、OSD和SD方面表现出令人信服的性能,例如在AISHELL-4数据集上达到14.5%的日志错误率(DER)。对自注意力权重的分析证明了其可解释性,因为它们与说话人的角度位置相关。
引用
@article{arxiv.2406.03251,
title = {ASoBO: Attentive Beamformer Selection for Distant Speaker Diarization in Meetings},
author = {Theo Mariotte and Anthony Larcher and Silvio Montresor and Jean-Hugh Thomas},
journal= {arXiv preprint arXiv:2406.03251},
year = {2024}
}
备注
5 pages, 2 figures, 2 tables, accepted at Interspeech 2024