中文

副语言增强的口语对话大语言建模

计算与语言 2024-01-18 v2 音频与语音处理

摘要

大语言模型(LLM)在聊天、推理和问答等任务中表现出卓越能力。然而,标准LLM可能忽略关键的副语言信息,如情感、情绪和说话风格,这些对于实现自然、类人的口语对话至关重要,尤其是当这些信息通过声学线索传递时。因此,我们提出了副语言增强生成式预训练Transformer(ParalinGPT),这是一种利用文本和语音模态更好地建模口语对话的语言内容和副语言属性的LLM。该模型将文本的对话上下文、语音嵌入和副语言属性作为输入提示,置于序列化多任务多模态框架中。具体来说,我们的框架按当前副语言属性预测、响应副语言属性预测和响应文本生成的顺序序列化任务,并采用自回归条件。我们使用Switchboard-1语料库(包括其情感标签作为副语言属性)作为口语对话数据集。实验结果表明,所提出的序列化多任务方法在当前和响应情感分类上优于典型的序列分类技术。此外,利用对话上下文和语音嵌入显著改善了响应文本生成和情感预测。我们的框架在当前情感准确率、响应情感准确率和响应文本BLEU分数上分别实现了6.7%、12.0%和3.5%的相对提升。

关键词

引用

@article{arxiv.2312.15316,
  title  = {Paralinguistics-Enhanced Large Language Modeling of Spoken Dialogue},
  author = {Guan-Ting Lin and Prashanth Gurunath Shivakumar and Ankur Gandhe and Chao-Han Huck Yang and Yile Gu and Shalini Ghosh and Andreas Stolcke and Hung-yi Lee and Ivan Bulyko},
  journal= {arXiv preprint arXiv:2312.15316},
  year   = {2024}
}

备注

Accepted by ICASSP 2024. Camera-ready version