G-STAR:面向全局说话人追踪与属性识别的端到端系统
音频与语音处理
2026-03-12 v1 人工智能
人机交互
多媒体
声音
摘要
本文研究带时间戳的多方语音说话人属性语音识别(ASR),用于长时段、重叠的多方会议场景,需在块级推理时保持会议级别的说话人身份一致性,同时生成带时间戳、带说话人标签的转录文本。先前的语音大语言模型(Speech-LLM)系统倾向于优先关注局部说话人分割或全局标记,却往往缺乏捕获细粒度时序边界或稳健的跨块身份关联能力。我们提出G-STAR,一种将时序感知的说话人追踪模块与语音-LLM转录主干网络耦合的端到端系统。追踪器提供带时序定位的结构化说话人线索,LLM基于这些线索生成带属性的文本。G-STAR支持组件级优化和联合端到端训练,实现了在异构监督和域迁移情况下的灵活学习。实验分析了线索融合、局部与长时序背景的权衡以及分层目标。
引用
@article{arxiv.2603.10468,
title = {G-STAR: End-to-End Global Speaker-Tracking Attributed Recognition},
author = {Jing Peng and Ziyi Chen and Haoyu Li and Yucheng Wang and Duo Ma and Mengtian Li and Yunfan Du and Dezhu Xu and Kai Yu and Shuai Wang},
journal= {arXiv preprint arXiv:2603.10468},
year = {2026}
}
备注
submitted to Interspeech 2026