CIF-PT:通过连续积分触发预训练桥接语音与文本表示以用于口语语言理解
计算与语言
2023-05-30 v1 多媒体
音频与语音处理
摘要
预训练模型生成的语音或文本表示含有模态特定信息,可加以结合以惠及口语语言理解(SLU)任务。本工作中,我们提出一种称为连续积分触发预训练(CIF-PT)的新预训练范式。它依赖于一种简单而有效的帧到词元对齐:连续积分触发(CIF)来桥接语音与文本间的表示。它通过 CIF 作为预训练(PT)联合执行语音到文本训练与语言模型蒸馏。在 SLU 基准 SLURP 数据集上评估,CIF-PT 在意图分类与槽填充任务上分别优于最先进模型 1.94% 的准确率与 2.71% 的 SLU-F1。我们还观察到 CIF-PT 提取的跨模态表示比其他神经接口(包括自监督预训练学习的主导语音表示)在 SLU 任务上取得更好性能。
引用
@article{arxiv.2305.17499,
title = {CIF-PT: Bridging Speech and Text Representations for Spoken Language Understanding via Continuous Integrate-and-Fire Pre-Training},
author = {Linhao Dong and Zhecheng An and Peihao Wu and Jun Zhang and Lu Lu and Zejun Ma},
journal= {arXiv preprint arXiv:2305.17499},
year = {2023}
}
备注
Accepted by ACL 2023 Findings