中文

仅靠 ASR + LLM 就能实现吗?探讨语音大语言模型识别和理解说话者的能力——基于口语对话的研究

计算与语言 2024-10-03 v3 音频与语音处理

摘要

近年来,我们注意到语音语言模型 (SpeechLLMs) 的快速进步,正在赶超人类的倾听和推理能力。SpeechLLMs 在类似高考语音听力测试(中国大学生 entrance exam 中的英文听力测试)等基准中的口语问答表现突出,似乎需要理解对话中的 spoken content 以及说话者的声音特征。然而,仔细检查高考问题后,我们发现许多问题的正确答案可以仅从对话转录文本中推断,即无需说话者的分段和识别。我们对最先进的模型 Qwen-Audio 和 WavLLM 在高考和我们提出的"你喜欢什么?"数据集上的表现进行评估,发现这些基于上下文的问题准确率显著高于身份关键问题的准确率——后者只能通过正确的说话者识别才能可靠地回答。结果和分析表明,当解决 SQA 时,当前的 SpeechLLMs 在音频方面的说话者意识有限,行为类似于仅从对话转录文本推理的 LLM。我们提议,聚焦于身份关键问题的任务可为 SpeechLLMs 在 SQA 中的评估提供更准确的框架。

关键词

引用

@article{arxiv.2409.04927,
  title  = {Just ASR + LLM? A Study on Speech Large Language Models' Ability to Identify and Understand Speaker in Spoken Dialogue},
  author = {Junkai Wu and Xulin Fan and Bo-Ru Lu and Xilin Jiang and Nima Mesgarani and Mark Hasegawa-Johnson and Mari Ostendorf},
  journal= {arXiv preprint arXiv:2409.04927},
  year   = {2024}
}

备注

Accepted to IEEE SLT 2024