基于模型无关可解释性的跨领域数据语言模型比较研究
计算与语言
2020-09-10 v1
摘要
随着近期双向上下文Transformer语言模型在自然语言处理(NLP)中的大量涌现,对这些模型在多种数据集上进行系统性比较研究变得十分必要。此外,这些语言模型的性能尚未在非GLUE数据集上得到探索。本文所呈现的研究比较了最先进的语言模型——BERT、ELECTRA及其衍生模型,包括RoBERTa、ALBERT和DistilBERT。我们通过微调这些模型以处理跨领域和异构数据进行了实验,并撰写了关于模型性能的深入分析。此外,本文提出了与预训练一致的语言模型可解释性,通过模型无关方法验证了这些模型的上下文捕捉能力。实验结果在Yelp 2013评分分类任务和Financial Phrasebank情感检测任务上分别以69%和88.2%的准确率确立了新的最先进水平(SOTA)。最后,本文所阐述的研究可极大协助工业界研究者在性能或计算效率方面有效选择语言模型。
引用
@article{arxiv.2009.04095,
title = {Comparative Study of Language Models on Cross-Domain Data with Model Agnostic Explainability},
author = {Mayank Chhipa and Hrushikesh Mahesh Vazurkar and Abhijeet Kumar and Mridul Mishra},
journal= {arXiv preprint arXiv:2009.04095},
year = {2020}
}
备注
6 pages Source code at https://github.com/fidelity/classitransformers PyPi https://pypi.org/project/classitransformers/