中文

ConvFiT:预训练语言模型的对话式微调

计算与语言 2021-09-22 v1

摘要

基于 Transformer 的语言模型(LM)在大型文本集合上预训练后被证明存储了丰富的语义知识。然而,1)它们作为句子编码器在开箱即用时并不有效,且 2)因此在意图检测(ID)等对话任务上通常落后于对话式预训练(例如通过回复选择)的编码器。在本工作中,我们提出 ConvFiT,一种简单高效的两阶段流程,可将任意预训练 LM 转变为通用对话编码器(在第 1 阶段 ConvFiT 之后)和任务专用句子编码器(在第 2 阶段之后)。我们证明:1)无需进行彻底的对话式预训练,LM 可以用更少量的无标注数据快速转化为有效的对话编码器;2)预训练 LM 可微调为任务专用句子编码器,针对特定任务的细粒度语义进行优化。因此,此类专用句子编码器可将 ID 视为基于可解释最近邻检索的简单语义相似度任务。我们在标准 ID 评测集上通过这种基于相似度的推断验证了 ConvFiT 框架的鲁棒性与通用性:ConvFiT 后的 LM 在各项设置中均达到最先进的 ID 性能,尤其在最具挑战性的少样本设定中提升明显。

关键词

引用

@article{arxiv.2109.10126,
  title  = {ConvFiT: Conversational Fine-Tuning of Pretrained Language Models},
  author = {Ivan Vulić and Pei-Hao Su and Sam Coope and Daniela Gerz and Paweł Budzianowski and Iñigo Casanueva and Nikola Mrkšić and Tsung-Hsien Wen},
  journal= {arXiv preprint arXiv:2109.10126},
  year   = {2021}
}

备注

EMNLP 2021 (long paper)