持续对比式口语语言理解
音频与语音处理
2024-06-05 v3 人工智能
摘要
近来,神经网络在多个领域取得令人瞩目的进展,语音处理亦不例外。然而,该领域近期突破需使用大规模数据集与巨大计算资源进行大量离线训练。遗憾的是,这些模型在持续学习新任务时难以保留已学知识,而从零重训几乎总是不切实际。本文中,我们研究在类增量学习(CIL)设定下为口语语言理解学习序列到序列模型的问题,并提出 COCONUT,一种依赖经验回放与对比学习结合的 CIL 方法。通过对仅应用于排练样本的标准监督对比损失进行修改,COCONUT 通过拉近同类样本、推远异类样本来保留所学表征。此外,我们利用多模态对比损失,通过对齐音频与文本特征帮助模型学习更具判别性的新数据表征。我们还探究不同的对比设计,以结合对比损失与用于蒸馏的教师-学生架构的优势。在两个成熟 SLU 数据集上的实验揭示了我们所提方法的有效性及对基线的显著提升。我们还表明 COCONUT 可与作用于模型解码器侧的方法结合,带来进一步的指标改善。
引用
@article{arxiv.2310.02699,
title = {Continual Contrastive Spoken Language Understanding},
author = {Umberto Cappellazzo and Enrico Fini and Muqiao Yang and Daniele Falavigna and Alessio Brutti and Bhiksha Raj},
journal= {arXiv preprint arXiv:2310.02699},
year = {2024}
}
备注
Accepted to ACL Findings 2024