中文

KNOT:基于最优传输的知识蒸馏用于求解 NLP 任务

计算与语言 2022-09-20 v2 人工智能 机器学习

摘要

我们提出一种新方法——基于最优传输的知识蒸馏(KNOT),用于将多个教师网络的自然语言语义知识蒸馏至学生网络。KNOT 旨在训练一个(全局)学生模型,通过学习最小化其于标签上所分配概率分布到(局部)教师模型预测概率加权和的最优传输代价,且约束为学生模型无法访问教师模型的参数或训练数据。为评估知识迁移质量,我们引入一个新度量——语义距离(SD),用于度量预测标签分布与真实标签分布间的语义接近度。所提方法在三个 NLP 任务上的全局模型 SD 表现优于基线,同时在标准准确率与 F1 指标上与基于熵的蒸馏表现相当。相关实现公开于:https://github.com/declare-lab/KNOT。

关键词

引用

@article{arxiv.2110.02432,
  title  = {KNOT: Knowledge Distillation using Optimal Transport for Solving NLP Tasks},
  author = {Rishabh Bhardwaj and Tushar Vaidya and Soujanya Poria},
  journal= {arXiv preprint arXiv:2110.02432},
  year   = {2022}
}

备注

COLING 2022