中文

流式语音识别中的实时词级时序分割

人机交互 2025-04-16 v1 多媒体 声音 音频与语音处理

摘要

富文本字幕对于帮助 deaf 及 hard-of-hearing(DHH)人群、第二语言学习者以及自闭谱系障碍(ASD)人群进行沟通至关重要。它们还能在语音转文本时保留细微差别,增强演示稿、对话或语音日志的真实感。然而,当前的实时字幕系统缺乏在词级对文本属性(例如大小写、大小和字体)进行修改的能力,这阻碍了准确传递语音语调或音调所表达的说话者意图。例如,"YOU should do this" 常被理解为 "You" 为句子焦点,而 "You should do THIS" 则常被理解为 "This" 为焦点。本文提出了解决方案,能够在实时水平上对文本修饰进行词级更改。作为原型,我们开发了一款应用程序,依据每个 spoken word 的音量调整词语大小。用户反馈表明,该系统有助于传递说话者的意图,提供更具参与感和可及性的字幕体验。

关键词

引用

@article{arxiv.2504.10849,
  title  = {Real-Time Word-Level Temporal Segmentation in Streaming Speech Recognition},
  author = {Naoto Nishida and Hirotaka Hiraki and Jun Rekimoto and Yoshio Ishiguro},
  journal= {arXiv preprint arXiv:2504.10849},
  year   = {2025}
}

备注

3 pages, 1 figures