中文

UniSLU:来自异构跨任务数据集的统一口语语言理解

音频与语音处理 2025-07-18 v1 人工智能 计算与语言 多媒体 声音

摘要

口语语言理解(SLU)在语音导向的多媒体应用中发挥着关键作用,使机器能够在会议、访谈和客户服务等情境中理解口语。SLU 包括多个任务,包括自动语音识别(ASR)、口语命名实体识别(NER)和口语情感分析(SA)。然而,现有方法常常依赖于针对单个任务(如口语 NER 和 SA)的独立模型架构,这增加了系统复杂性,限制了跨任务交互,无法充分利用跨任务中可用的异构数据集。为此,我们提出 UniSLU,一个单一架构中联合建模多个 SLU 任务的统一框架。具体而言,我们提出了一种针对 diverse SLU 任务的统一表示,实现了对多个任务中异构数据集的充分利用。基于此表示,我们提出一种统一的生成方法,联合建模 ASR、口语 NER 和 SA 任务,增强任务间交互,实现与大型语言模型的无缝集成,以发挥其强大的生成能力。在公开的 SLU 数据集上进行大量实验表明,我们的方法有效,相较于多个基准方法实现了卓越的 SLU 性能,非常适合实际的基于语音的多媒体场景。我们将在 github 上发布所有代码和模型以促进未来研究。

关键词

引用

@article{arxiv.2507.12951,
  title  = {UniSLU: Unified Spoken Language Understanding from Heterogeneous Cross-Task Datasets},
  author = {Zhichao Sheng and Shilin Zhou and Chen Gong and Zhenghua Li},
  journal= {arXiv preprint arXiv:2507.12951},
  year   = {2025}
}

备注

13 pages, 3 figures