广义零样本音频到意图分类
声音
2023-11-07 v1 人工智能
机器学习
音频与语音处理
摘要
仅使用音频数据的口语理解系统日益流行,但其处理未见意图的能力仍然有限。在本研究中,我们提出了一种广义零样本音频到意图分类框架,每个意图仅使用少量文本句子样本。为此,我们首先利用自监督预训练模型训练一个有监督的音频到意图分类器。然后,我们借助神经音频合成器为文本话语样本生成音频嵌入,并使用余弦相似度对未见意图进行广义零样本分类。我们还提出了一种多模态训练策略,将词汇信息融入音频表示以提升零样本性能。与仅音频训练相比,我们的多模态训练方法在 SLURP 和内部面向目标对话数据集的未见意图上,分别将零样本意图分类准确率提升了 2.75% 和 18.2%。
引用
@article{arxiv.2311.02482,
title = {Generalized zero-shot audio-to-intent classification},
author = {Veera Raghavendra Elluru and Devang Kulshreshtha and Rohit Paturi and Sravan Bodapati and Srikanth Ronanki},
journal= {arXiv preprint arXiv:2311.02482},
year = {2023}
}