TellWhisper:告诉 Whisper 谁在说话
音频与语音处理
2026-04-15 v3
摘要
多说话人自动语音识别(MASR)旨在从多说话人语音中预测“谁何时说话”和“说了什么”,是多方对话理解的关键技术。然而,现有大多数方法在处理“何时”和“谁”时,都会将时序建模与说话人建模解耦:有的在编码前注入说话人线索(如说话人掩码),可能导致信息不可逆损失;还有的在编码后融合说话人后验概率,可能使声学内容与说话人身份纠缠。这种分离方式在快速轮次和重叠语音情况下极其脆弱,常导致性能下降。为此,我们提出TellWhisper,一个统一框架,联合建模语音编码器中的说话人身份与时序信息。具体而言,我们设计了TS-RoPE(Time-Speaker Rotary Positional Encoding)——时序坐标来源于帧索引,而说话人坐标来源于说话人活动和停顿线索。通过应用区域特定的旋转角度,模型显式捕获每个说话人的连续性、说话人轮次转换和状态动态,使注意力机制能够同时关注“何时”和“谁”。此外,为估计帧级说话人活动,我们开发了Hyper-SD(Hyperbolic Speaker Discrimination),将说话人分类问题置于双曲空间中,以增强类别间间隔并细化说话人活动估计。大量实验表明,本文方法有效。
关键词
引用
@article{arxiv.2601.03712,
title = {TellWhisper: Tell Whisper Who Speaks When},
author = {Yifan Hu and Peiji Yang and Zhisheng Wang and Yicheng Zhong and Rui Liu},
journal= {arXiv preprint arXiv:2601.03712},
year = {2026}
}
备注
14 pages, 6 figures, 8 tables, accepted by ACL 2026 (Main)