通过迁移稀疏教师以极少资源实现跨语言文本分类
计算与语言
2020-10-07 v1
摘要
跨语言文本分类通过利用其他语言的标注文档,缓解了对目标语言人工标注文档的需求。现有的跨语言监督迁移方法需要昂贵的跨语言资源(如平行语料库),而较廉价的跨语言表示学习方法在不使用目标语言标注文档的情况下训练分类器。本文提出一种跨语言师生方法 CLTS,其利用极少的跨语言资源(以少量词翻译的形式)在目标语言中生成“弱”监督。在给定有限翻译预算的情况下,CLTS 跨语言提取并迁移仅最具任务特异性的种子词,并基于翻译后的种子词初始化一个教师分类器。随后,CLTS 迭代训练一个更强大的学生模型,该模型同时利用目标语言无标注文档中种子词的上下文,并优于教师。CLTS 简单且在 18 种多样语言中出奇有效:仅迁移 20 个种子词,即便是词袋逻辑回归学生模型也优于最先进的跨语言方法(例如基于多语言 BERT 的方法)。此外,CLTS 可适配任意类型的学生分类器:借助单语 BERT 学生模型可带来进一步提升,准确率比更昂贵的方法高出至多 12%。最后,CLTS 仅使用少量词翻译即可应对低资源语言中的新兴任务。
引用
@article{arxiv.2010.02562,
title = {Cross-Lingual Text Classification with Minimal Resources by Transferring a Sparse Teacher},
author = {Giannis Karamanolakis and Daniel Hsu and Luis Gravano},
journal= {arXiv preprint arXiv:2010.02562},
year = {2020}
}
备注
Accepted to Findings of EMNLP 2020 (Long Paper)