中文

切换点偏置自训练:重新利用预训练模型处理语码转换

计算与语言 2021-11-03 v1

摘要

语码转换(CS)因其在多语社区中提供的交流便利而是一种普遍现象,但在语言处理中仍属研究不足的问题。造成这一现象的主要原因有:(1)在利用大型预训练多语言模型方面努力不足;(2)缺乏标注数据。多语言模型在CS上表现低下的显著情况是句内语言混合导致切换点。我们首先在4种不同语言对上以一系列预训练模型对两项序列标注任务——词性标注(POS)和命名实体识别(NER)——进行基准测试,以识别问题并从中选出表现最佳的模型char-BERT(解决(1))。随后我们提出一种自训练方法,利用无标注数据并通过切换点偏置来重新利用现有预训练模型(解决(2))。我们最终证明,我们的方法在两项任务上均表现良好,缩小了切换点性能差距,同时在两项任务的两个不同语言对上保持了整体性能。我们的代码见:https://github.com/PC09/EMNLP2021-Switch-Point-biased-Self-Training。

关键词

引用

@article{arxiv.2111.01231,
  title  = {Switch Point biased Self-Training: Re-purposing Pretrained Models for Code-Switching},
  author = {Parul Chopra and Sai Krishna Rallabandi and Alan W Black and Khyathi Raghavi Chandu},
  journal= {arXiv preprint arXiv:2111.01231},
  year   = {2021}
}

备注

Accepted at EMNLP Findings 2021