中文

PT-CoDE:用于话语级情感识别的预训练上下文相关编码器

计算与语言 2019-10-22 v1

摘要

话语级情感识别(ULER)是人工智能领域中理解人类行为与开发共情聊天机器的重要研究课题。与传统文本分类问题不同,该任务所依赖的数据集数量有限,且其中大多数包含不充分的对话或语音。这种数据稀缺问题限制了为该任务训练更大更强模型的可能性。鉴于迁移学习在自然语言处理(NLP)中的成功,我们提出通过从无标注对话数据中学习,为 ULER 预训练一个上下文相关编码器(CoDE)。本质上,CoDE 是一种包含话语编码器与对话编码器的分层架构,这使其不同于那些旨在预训练通用句子编码器的工作。此外,我们提出一种名为“对话补全”(CoCo)的新预训练任务,该任务试图从候选答案中选出正确答案以填充问答对话中被掩码的话语。CoCo 任务在纯电影字幕上执行,从而使我们的 CoDE 能以无监督方式预训练。最后,预训练的 CoDE(PT-CoDE)针对 ULER 进行微调,并在五个数据集上显著提升模型性能。

关键词

引用

@article{arxiv.1910.08916,
  title  = {PT-CoDE: Pre-trained Context-Dependent Encoder for Utterance-level Emotion Recognition},
  author = {Wenxiang Jiao and Michael R. Lyu and Irwin King},
  journal= {arXiv preprint arXiv:1910.08916},
  year   = {2019}
}

备注

10 pages, 3 figures