勿用英语验证集:关于上下文嵌入的零样本跨语言评测
计算与语言
2020-10-07 v2 机器学习
摘要
多语言上下文嵌入在零样本跨语言迁移学习中已展现出最先进的性能,其中多语言 BERT 在一种源语言上微调并在不同的目标语言上评测。然而,四篇论文中 mBERT 在 MLDoc 分类任务上的零样本准确率公布结果相差多达 17 个百分点。我们表明,在零样本设定下使用英语验证集准确率进行模型选择的惯例,使得在 MLDoc 与 XNLI 任务上难以获得可复现结果。英语验证集准确率常与目标语言准确率不相关(甚至反相关),且零样本性能在同一微调过程的不同阶段以及不同微调过程之间差异巨大。这些可复现性问题也存在于使用不同预训练嵌入的其他任务中(例如采用 XLM-R 的 MLQA)。我们建议 alongside 零样本结果提供预言分数:仍使用英语数据微调,但用目标语言验证集选择检查点。报告这一上界可通过避免任意糟糕的检查点使结果更为一致。
引用
@article{arxiv.2004.15001,
title = {Don't Use English Dev: On the Zero-Shot Cross-Lingual Evaluation of Contextual Embeddings},
author = {Phillip Keung and Yichao Lu and Julian Salazar and Vikas Bhardwaj},
journal= {arXiv preprint arXiv:2004.15001},
year = {2020}
}
备注
To appear in EMNLP 2020