自然语言理解任务中基于 Transformer 模型的压测评估
人工智能
2020-03-31 v2
摘要
近年来,得益于 Transformer 架构的引入,自然语言处理领域取得了显著进展。当前最先进的模型通过大量参数与在海量文本语料上的预训练,在若干下游任务上展现了令人印象深刻的成果。许多研究者已对先前(非 Transformer)模型进行研究以理解其在不同场景下的实际行为,表明这些模型利用了数据集的线索或缺陷,且输入数据的轻微扰动即可严重降低其性能。相比之下,近期模型尚未通过对抗样本进行系统测试,以展示其在严峻压力条件下的鲁棒性。因此,本工作评估了三种基于 Transformer 的模型(RoBERTa、XLNet 与 BERT)在自然语言推理(Natural Language Inference, NLI)与问答(Question Answering, QA)任务上的表现,以探明它们是否更具鲁棒性,或与其前身存在相同缺陷。结果表明,RoBERTa、XLNet 与 BERT 在 NLI 与 QA 任务上均比循环神经网络模型对压力测试更具鲁棒性。然而,它们仍非常脆弱并表现出多种非预期行为,从而揭示该领域仍有改进空间。
引用
@article{arxiv.2002.06261,
title = {Stress Test Evaluation of Transformer-based Models in Natural Language Understanding Tasks},
author = {Carlos Aspillaga and Andrés Carvallo and Vladimir Araujo},
journal= {arXiv preprint arXiv:2002.06261},
year = {2020}
}
备注
Accepted paper LREC2020