探索 BERT 在斯坦福问答数据集 v2.0 上的参数效率
计算与语言
2020-03-04 v2 机器学习
机器学习
摘要
本文中,我们探索 BERT arXiv:1810.04805 在斯坦福问答数据集 2.0 版(SQuAD2.0)上的参数效率。我们在冻结不同数量的最终 transformer 层以及包含 arXiv:1902.00751 中提出的适配器层的情况下评估 BERT 的参数效率。此外,我们尝试使用 arXiv:1709.08294v3 中描述的上下文感知卷积(CACNN)滤波器,作为 SQuAD2.0 任务的最终增强层。该探索部分受 arXiv:1907.10597 推动,其令人信服地主张将人工智能模型的评估标准拓宽至包含各种资源效率度量。尽管我们未如 arXiv:1907.10597 所提议基于浮点运算效率评估这些模型,我们考察了关于训练时间、推理时间与模型参数总量的效率。我们的结果在很大程度上证实了 arXiv:1902.00751 关于适配器模块的结论,同时也表明由于训练与推理时间的增加,添加上下文感知卷积滤波器所带来的 F1 分数提升并不实用。
引用
@article{arxiv.2002.10670,
title = {Exploring BERT Parameter Efficiency on the Stanford Question Answering Dataset v2.0},
author = {Eric Hulburd},
journal= {arXiv preprint arXiv:2002.10670},
year = {2020}
}
备注
11 pages, 5 figures, 3 tables