流式语音识别中的实时词级时序分割
人机交互
2025-04-16 v1 多媒体
声音
音频与语音处理
摘要
富文本字幕对于帮助 deaf 及 hard-of-hearing(DHH)人群、第二语言学习者以及自闭谱系障碍(ASD)人群进行沟通至关重要。它们还能在语音转文本时保留细微差别,增强演示稿、对话或语音日志的真实感。然而,当前的实时字幕系统缺乏在词级对文本属性(例如大小写、大小和字体)进行修改的能力,这阻碍了准确传递语音语调或音调所表达的说话者意图。例如,"YOU should do this" 常被理解为 "You" 为句子焦点,而 "You should do THIS" 则常被理解为 "This" 为焦点。本文提出了解决方案,能够在实时水平上对文本修饰进行词级更改。作为原型,我们开发了一款应用程序,依据每个 spoken word 的音量调整词语大小。用户反馈表明,该系统有助于传递说话者的意图,提供更具参与感和可及性的字幕体验。
引用
@article{arxiv.2504.10849,
title = {Real-Time Word-Level Temporal Segmentation in Streaming Speech Recognition},
author = {Naoto Nishida and Hirotaka Hiraki and Jun Rekimoto and Yoshio Ishiguro},
journal= {arXiv preprint arXiv:2504.10849},
year = {2025}
}
备注
3 pages, 1 figures