MOSS Transcribe Diarize 技术报告
声音
2026-01-21 v5 人工智能
音频与语音处理
摘要
Speaker-Attributed, Time-Stamped Transcription (SATS) 旨在转录说话内容并精确定位每个说话人的时刻,这对于会议转录尤其有价值。现有的 SATS 系统很少采用端到端方案,并且受限于有限的上下文窗口、较弱的长期说话人记忆以及无法输出时间戳。为解决这些限制,我们提出了 MOSS Transcribe Diarize,一个统一的多模态大型语言模型,能够在端到端范式中联合执行说话人属性化、时间戳转录。该模型在大量真实野生数据上训练,并配备128k上下文窗口以支持最长90分钟的输入,规模化且具备良好的鲁棒性。在全面的评估中,它在多个公共和内部基准测试中超越了最先进的商业系统。
引用
@article{arxiv.2601.01554,
title = {MOSS Transcribe Diarize Technical Report},
author = {MOSI. AI and : and Donghua Yu and Zhengyuan Lin and Chen Yang and Yiyang Zhang and Hanfu Chen and Jingqi Chen and Ke Chen and Liwei Fan and Yi Jiang and Jie Zhu and Muchen Li and Wenxuan Wang and Yang Wang and Zhe Xu and Yitian Gong and Yuqian Zhang and Wenbo Zhang and Songlin Wang and Zhiyu Wu and Zhaoye Fei and Qinyuan Cheng and Shimin Li and Xipeng Qiu},
journal= {arXiv preprint arXiv:2601.01554},
year = {2026}
}