BERT、ALBERT 与 LongFormer 在 DuoRC 上的网格搜索超参数基准测试
计算与语言
2021-03-30 v2 机器学习
摘要
本项目的目的是在名为 DuoRC 的问答数据集上评估三个语言模型 BERT、ALBERT 和 LongFormer。该语言模型任务有两个输入:一个问题和一段上下文。上下文是一个段落或整篇文档,而输出是基于上下文的答案。目标是使用 DuoRC 进行网格搜索超参数微调。模型的预训练权重取自 Huggingface 库。使用两组不同的超参数,借助 DuoRC 的两个版本(SelfRC 和 ParaphraseRC)对模型进行微调。结果表明,ALBERT(使用 SQuAD1 数据集预训练)在 SelfRC 数据集上微调后 F1 分数为 76.4,准确率为 68.52。Longformer 模型(使用 SQuAD 和 SelfRC 数据集预训练)在 ParaphraseRC 数据集上微调后 F1 分数为 52.58,准确率为 46.60。当前结果优于 DuoRC 先前模型的成果。
引用
@article{arxiv.2101.06326,
title = {Grid Search Hyperparameter Benchmarking of BERT, ALBERT, and LongFormer on DuoRC},
author = {Alex John Quijano and Sam Nguyen and Juanita Ordonez},
journal= {arXiv preprint arXiv:2101.06326},
year = {2021}
}
备注
9 pages, 2 figures, 2 tables