BERT 与 ALBERT 句子嵌入在下游 NLP 任务上的性能评估
计算与语言
2021-01-27 v1 人工智能
摘要
来自预训练语言模型的上下文表示是实现下游 NLP 任务高性能的核心。预训练的 BERT 与 A Lite BERT(ALBERT)模型可被微调以在句子对回归任务(如语义文本相似度(STS)与自然语言推理(NLI))上给出最先进的结果。尽管基于 BERT 的模型产出 [CLS] 令牌向量作为合理的句子嵌入,对最优句子嵌入方案的探索仍是计算语言学中的活跃研究领域。本文探究了 BERT 与 ALBERT 的句子嵌入模型。特别地,我们采用称为 Sentence-BERT(SBERT)的具有连体与三元组网络结构的改进 BERT 网络,并将 BERT 替换为 ALBERT 以创建 Sentence-ALBERT(SALBERT)。我们还对 SBERT 与 SALBERT 试验了外部 CNN 句子嵌入网络。我们使用 STS 与 NLI 数据集评估了所考虑的所有句子嵌入模型的性能。实证结果表明,我们的 CNN 架构在 STS 基准上对 ALBERT 模型的提升显著大于对 BERT 模型的提升。尽管模型参数量显著更少,ALBERT 句子嵌入在下游 NLP 评估中与 BERT 极具竞争力。
引用
@article{arxiv.2101.10642,
title = {Evaluation of BERT and ALBERT Sentence Embedding Performance on Downstream NLP Tasks},
author = {Hyunjin Choi and Judong Kim and Seongho Joe and Youngjune Gwon},
journal= {arXiv preprint arXiv:2101.10642},
year = {2021}
}
备注
6 pages, 2 figures, to be published in 25th International Conference on Pattern Recognition, ICPR2020