中文

基于大语言模型的后续对话中设备定向语音检测

音频与语音处理 2024-11-06 v2 人工智能 计算与语言 声音

摘要

与虚拟助手(VA)的后续对话使用户能够无缝地与VA交互,而无需在首次查询后重复使用关键词唤醒它。因此,从后续查询中准确进行设备定向语音检测(DDSD)对于实现自然的用户体验至关重要。为此,我们探索了大语言模型(LLM)的概念,并在对后续查询进行推理时(基于ASR解码文本),通过对预训练LLM进行提示,或在LLM之上适配一个二分类器,来对第一个查询进行建模。在此过程中,我们在设计LLM提示时也利用了ASR的不确定性。我们在真实世界的后续对话数据集上表明,与单独对后续查询建模相比,由于对先前语音上下文和ASR不确定性进行了联合建模,这种方法带来了巨大的收益(在10%固定错误拒绝率下,错误警报减少20-40%)。

关键词

引用

@article{arxiv.2411.00023,
  title  = {Device-Directed Speech Detection for Follow-up Conversations Using Large Language Models},
  author = {Ognjen and Rudovic and Pranay Dighe and Yi Su and Vineet Garg and Sameer Dharur and Xiaochuan Niu and Ahmed H. Abdelaziz and Saurabh Adya and Ahmed Tewfik},
  journal= {arXiv preprint arXiv:2411.00023},
  year   = {2024}
}