基于声学与大语言模型融合的话轮转换与反馈预测
计算与语言
2024-01-29 v1 人工智能
机器学习
声音
音频与语音处理
摘要
我们提出了一种通过融合神经声学模型和大语言模型(LLM)来连续预测口语对话中话轮转换和反馈位置的方法。在Switchboard人-人对话数据集上的实验表明,我们的方法始终优于单一模态的基线模型。我们还开发了一种新颖的多任务指令微调策略,以进一步利用LLM编码的知识来理解任务和对话上下文,从而带来额外的改进。我们的方法展示了结合LLM和声学模型在人类与语音AI代理之间实现更自然、更具对话性的交互的潜力。
引用
@article{arxiv.2401.14717,
title = {Turn-taking and Backchannel Prediction with Acoustic and Large Language Model Fusion},
author = {Jinhan Wang and Long Chen and Aparna Khare and Anirudh Raju and Pranav Dheram and Di He and Minhua Wu and Andreas Stolcke and Venkatesh Ravichandran},
journal= {arXiv preprint arXiv:2401.14717},
year = {2024}
}
备注
To appear in IEEE ICASSP 2024