中文

预训练Transformer语言模型用于开放域对话生成的实证研究

计算与语言 2020-03-10 v1 人工智能

摘要

本文针对开放域对话生成任务,对基于Transformer的预训练自回归语言模型进行了实证研究。我们采用预训练与微调的训练范式进行参数学习。分别收集了中英文的新闻与维基百科语料用于预训练阶段。在微调阶段,将对话上下文与回复拼接为单一序列作为模型输入。我们设计了一种针对上下文与回复的加权联合预测范式,用以评估带或不带上下文预测损失项的模型性能。采用了贪心搜索、束搜索、top-k采样等多种解码策略进行回复文本生成。在微博、豆瓣、Reddit、DailyDialog和Persona-Chat等典型的单轮与多轮对话语料上进行了大量实验,并给出了语言模型及基线方法在生成结果相关性与多样性上的自动评价指标详细数值。

关键词

引用

@article{arxiv.2003.04195,
  title  = {An Empirical Investigation of Pre-Trained Transformer Language Models for Open-Domain Dialogue Generation},
  author = {Piji Li},
  journal= {arXiv preprint arXiv:2003.04195},
  year   = {2020}
}

备注

26 pages