面向开放域角色感知对话生成的专用模型的改进
计算与语言
2020-08-28 v1
摘要
本文分析了近年来Transformer架构的一些速度与性能改进方法,主要是其在专用模型训练中的应用。此处所研究的专用模型指开放域角色感知对话生成模型,数据集为多轮短对话,单个输入序列的总长度不超过105个token。因此,本文不讨论Transformer架构中针对长序列处理的架构与注意力机制的诸多改进。实验源代码已开源:https://github.com/ghosthamlet/persona
关键词
引用
@article{arxiv.2008.11970,
title = {Improvement of a dedicated model for open domain persona-aware dialogue generation},
author = {Qiang Han},
journal= {arXiv preprint arXiv:2008.11970},
year = {2020}
}