中文

面向对话序列标注的分层知识蒸馏

计算与语言 2021-11-23 v1 机器学习

摘要

本文提出一种新颖的面向对话序列标注的知识蒸馏方法。对话序列标注是一种有监督学习任务,用于估计目标对话文档中每一条话语的标签,并可应用于诸多场景,如对话行为估计。准确的标注通常由分层结构的大模型实现,该模型由话语级与对话级网络构成,分别捕捉话语内与话语间的上下文。然而,由于其较大的模型规模,此类模型无法部署于资源受限设备。为克服该困难,我们聚焦于知识蒸馏,即通过蒸馏大型高性能教师模型的知识来训练小模型。我们的核心思路是在蒸馏知识的同时保留教师模型所捕捉的复杂上下文。为此,所提的分层知识蒸馏方法不仅蒸馏标签分类的概率分布,还通过训练小模型模仿教师模型各层级输出,来蒸馏教师模型中训练得到的话语级与对话级上下文知识。在对话行为估计与通话场景分割上的实验证明了所提方法的有效性。

关键词

引用

@article{arxiv.2111.10957,
  title  = {Hierarchical Knowledge Distillation for Dialogue Sequence Labeling},
  author = {Shota Orihashi and Yoshihiro Yamazaki and Naoki Makishima and Mana Ihori and Akihiko Takashima and Tomohiro Tanaka and Ryo Masumura},
  journal= {arXiv preprint arXiv:2111.10957},
  year   = {2021}
}

备注

Accepted at ASRU 2021