中文

双模式自监督语音模型的在线寄存器:缓解未来上下文缺失

声音 2026-03-02 v1

摘要

双模式自监督语音模型(S3M)在离线和在线模式联合预训练,因缺少未来上下文而在流式场景中遭受注意力不匹配。为此,我们提出在线寄存器(online registers),即附加到每个块的可学习标记。这些标记充当不可见未来帧的虚拟占位符,使模型能够在不引入额外延迟的前提下补偿缺失的上下文。此外,我们引入未来预测损失(future prediction loss),显式指导寄存器捕获预测线索,从而丰富其保留未来信息的能力。在 LibriSpeech 及 out-of-domain 基准测试上的实验表明,online registers 能持续减少离线模式与在线模式之间的性能差距,在 160ms 块大小的 LibriSpeech 上实现 3.4% 的相对改进,尤其在低延迟设置下效果显著。

关键词

引用

@article{arxiv.2602.23702,
  title  = {Online Register for Dual-Mode Self-Supervised Speech Models: Mitigating The Lack of Future Context},
  author = {Keita Goto and Takashi Maekaku and Jin Sakuma and Jinchuan Tian and Yusuke Shinohara and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2602.23702},
  year   = {2026}
}

备注

Accepted to ICASSP 2026