KNOT:基于最优传输的知识蒸馏用于求解 NLP 任务
计算与语言
2022-09-20 v2 人工智能
机器学习
摘要
我们提出一种新方法——基于最优传输的知识蒸馏(KNOT),用于将多个教师网络的自然语言语义知识蒸馏至学生网络。KNOT 旨在训练一个(全局)学生模型,通过学习最小化其于标签上所分配概率分布到(局部)教师模型预测概率加权和的最优传输代价,且约束为学生模型无法访问教师模型的参数或训练数据。为评估知识迁移质量,我们引入一个新度量——语义距离(SD),用于度量预测标签分布与真实标签分布间的语义接近度。所提方法在三个 NLP 任务上的全局模型 SD 表现优于基线,同时在标准准确率与 F1 指标上与基于熵的蒸馏表现相当。相关实现公开于:https://github.com/declare-lab/KNOT。
引用
@article{arxiv.2110.02432,
title = {KNOT: Knowledge Distillation using Optimal Transport for Solving NLP Tasks},
author = {Rishabh Bhardwaj and Tushar Vaidya and Soujanya Poria},
journal= {arXiv preprint arXiv:2110.02432},
year = {2022}
}
备注
COLING 2022