受码切换启发的损失函数用于通用口语对话表示
计算与语言
2021-09-10 v2 人工智能
摘要
口语对话系统需要能够处理多种语言以及对话内的多语现象(例如码切换情形)。在本工作中,我们引入新的预训练损失,专为学习多语言口语对话表示而设计。这些损失的目标是使模型暴露于码切换语言。为扩大训练规模,我们自动构建了一个预训练语料库,由来自\texttt{OpenSubtitles}的五种不同语言(法语、意大利语、英语、德语和西班牙语)的多语言对话组成,该多语言语料库包含24.3G tokens。我们在\texttt{MIAM}上测试该通用表示,\texttt{MIAM}是一个由上述相同语言的五个对话行为语料库组成的新基准,以及两个新颖的多语言下游任务(即多语言掩码话语检索和多语言不一致性识别)。我们的实验表明,我们新的受码切换启发的损失在单语言和多语言设定下均取得更好性能。
引用
@article{arxiv.2108.12465,
title = {Code-switched inspired losses for generic spoken dialog representations},
author = {Emile Chapuis and Pierre Colombo and Matthieu Labeau and Chloe Clavel},
journal= {arXiv preprint arXiv:2108.12465},
year = {2021}
}