中文

BoSS:超越语义的语音

声音 2025-07-24 v1 计算与语言 音频与语音处理

摘要

人类交流不仅涉及显性语义,隐性信号和情境线索在塑造意义方面发挥着关键作用。然而,现代语音技术,如自动语音识别(ASR)和文本转语音(TTS),往往无法捕捉这些超越语义的维度。为更好地 characterize 和评估语音智能的发展进程,我们引入了口头交互系统能力水平(L1-L5),这是一个层次化框架,说明了从基本命令识别到类人社交互动的口头对话系统的演变。为支持这些先进的能力,我们提出了超越语义语音(Beyond-Semantic Speech,BoSS),指的是语音交流中包含但超越显性语义的信息。它传递情感、情境,并通过情感线索、情境动态和隐式语义等多维特征来修改或扩展意义,从而增强对交际意图和情境的理解。我们Present了BoSS的形式化框架,利用认知相关理论和机器学习模型来分析语音的时序和情境动态。我们在五个不同维度上评估了BoSS相关属性,发现当前的口头语言模型(SLMs)难以完全解释超越语义信号。这些发现突显了推进BoSS研究以实现更丰富、更具情境感知的人机交流的必要性。

关键词

引用

@article{arxiv.2507.17563,
  title  = {BoSS: Beyond-Semantic Speech},
  author = {Qing Wang and Zehan Li and Hang Lv and Hongjie Chen and Yaodong Song and Jian Kang and Jie Lian and Jie Li and Yongxiang Li and Zhongjiang He and Xuelong Li},
  journal= {arXiv preprint arXiv:2507.17563},
  year   = {2025}
}