中文

评估语音大语言模型中的语境与副语言推理能力:一项基于真实场景数据的案例研究

计算与语言 2025-09-25 v2 人工智能

摘要

最近的语音大语言模型(speech-LLMs)在转录和翻译等任务中表现出色,但在理解对社交和情感智能至关重要的副语言方面仍然能力有限。我们提出了CP-Bench,一个用于评估语音大语言模型在语境副语言推理(即整合言语内容与情感、韵律等非言语线索)方面能力的基准。该基准包含两个精心构建的问答(QA)数据集,要求同时具备语言理解和共情理解能力。我们评估了来自开源和闭源模型的最先进的语音大语言模型,并对不同问题类型进行了全面分析。对表现最好的两个模型进一步进行了温度调节分析,以了解其对该任务的影响。我们的基准揭示了现有评估中的一个关键缺口,并为构建更具语境感知和情感智能的语音大语言模型提供了见解。

关键词

引用

@article{arxiv.2509.16589,
  title  = {Benchmarking Contextual and Paralinguistic Reasoning in Speech-LLMs: A Case Study with In-the-Wild Data},
  author = {Qiongqiong Wang and Hardik Bhupendra Sailor and Tianchi Liu and Wenyu Zhang and Muhammad Huzaifah and Nattadaporn Lertcheva and Shuo Sun and Nancy F. Chen and Jinyang Wu and AiTi Aw},
  journal= {arXiv preprint arXiv:2509.16589},
  year   = {2025}
}

备注

Accepted in EMNLP Findings 2025