TagSpeech:基于细粒度时间锚点的端到端多说话人语音识别与说话人识别
音频与语音处理
2026-01-13 v1 计算与语言
摘要
我们提出TagSpeech,一个统一的LLM-based框架,利用时间锚点grounding实现联合多说话人语音识别与说话人识别。该框架基于两个关键设计:(1)通过序列化输出训练(SOT)解耦语义与说话人流,学习说话轮转 dynamics;(2)交错时间锚点机制,不仅支持细粒度时间戳预测,还充当语义理解与说话人跟踪之间的同步信号。与之前主要关注说话人归属语音识别或隐式说话人识别的工作不同,TagSpeech解决了细粒度说话人-内容对齐挑战,端到端建模“谁在何时说话”。在AMI和AliMeeting基准测试上进行实验,表明该方法在Diarization Error Rate(DER)上 consistently优于强大的端到端基线,包括Qwen-Omni和 Gemini,尤其擅长处理复杂语音重叠。此外,TagSpeech采用参数高效训练范式,冻结LLM主干网络,仅训练轻量级投影层,在低计算成本下实现强大性能。
引用
@article{arxiv.2601.06896,
title = {TagSpeech: End-to-End Multi-Speaker ASR and Diarization with Fine-Grained Temporal Grounding},
author = {Mingyue Huo and Yiwen Shao and Yuheng Zhang},
journal= {arXiv preprint arXiv:2601.06896},
year = {2026}
}