中文

关于基座特征在基于基础模型的说话人计时中的作用

音频与语音处理 2026-01-06 v1

摘要

近期的说话人计时研究利用大型预训练基础模型(如 WavLM)在多个数据集上实现了最先进的性能。诸如 DiariZen 之类的系统利用这些丰富的单通道表示,但仅限于单通道音频,无法利用多通道录音中可用的空间线索。本文通过评估多种针对单通道计时系统的条件化策略,分析了将空间信息纳入最先进的单通道计时系统中的影响。会议式数据集上的实验表明,空间信息可以提高说话人计时性能,但对于所提出的系统而言,整体改进小于预期,这表明填充所有 WavLM 层的特征已经捕获了用于准确说话人区分的大量信息,包括重叠语音区域。这些发现为利用空间线索增强基础模型计时提供了潜力和局限性的见解。

关键词

引用

@article{arxiv.2601.02231,
  title  = {On the Role of Spatial Features in Foundation-Model-Based Speaker Diarization},
  author = {Marc Deegen and Tobias Gburrek and Tobias Cord-Landwehr and Thilo von Neumann and Jiangyu Han and Lukáš Burget and Reinhold Haeb-Umbach},
  journal= {arXiv preprint arXiv:2601.02231},
  year   = {2026}
}

备注

Accepted at HSCMA 2026