中文

融合对话历史的口语理解任务联合建模

计算与语言 2023-05-02 v1 声音 音频与语音处理

摘要

大多数人类交互以口语对话的形式发生,其中给定话语的语义含义依赖于上下文。口语对话中的每句话语可由许多语义和说话人属性表示,并且人们一直致力于构建口语理解(SLU)系统来自动预测这些属性。近期研究表明,融入对话历史有助于提升 SLU 性能。然而,每个 SLU 任务均使用独立模型,导致推理时间与计算成本增加。受此启发,我们旨在探究:能否在融入上下文的同时联合建模所有 SLU 任务,以实现低延迟与轻量推理?为回答该问题,我们提出了一种新颖的模型架构,其学习对话上下文以联合预测口语话语的意图、对话行为、说话人角色与情感。需注意,我们的联合预测基于自回归模型,且必须决定对话属性的预测顺序,这并非易事。为缓解该问题,我们还提出了一种顺序无关的训练方法。实验表明,我们的联合模型取得了与任务特定分类器相近的结果,并能有效融合对话上下文以进一步提升 SLU 性能。

关键词

引用

@article{arxiv.2305.00926,
  title  = {Joint Modelling of Spoken Language Understanding Tasks with Integrated Dialog History},
  author = {Siddhant Arora and Hayato Futami and Emiru Tsunoo and Brian Yan and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2305.00926},
  year   = {2023}
}

备注

Accepted at ICASSP 20223