中文

微调后的常识语言模型真的具备泛化能力吗

计算与语言 2020-11-19 v1 人工智能

摘要

近来,基于 Transformer 的方法(如 RoBERTa 和 GPT-3)在问答和常识推理等自然语言处理任务上取得了显著的实验进展。后者通常通过对前者的多重基准测试以多选题实例的形式进行评估。根据 Allen Institute 主持的具有影响力的排行榜(评估常识推理基准上的最先进性能),基于此类 Transformer 方法的模型正接近类人表现,且在许多基准上的平均准确率远超 80%。由于这些是常识基准,一个在常识推理上具备泛化能力的模型在多个常识基准之间不应出现太大的性能损失。本文通过设计并开展一项严谨的科学研究,详细探讨了泛化问题。利用五个常用基准、多重对照与统计分析,我们发现了明确证据:即便实验设置仅有适度改变,微调后的常识语言模型仍然泛化不佳,且事实上可能易受数据集偏倚影响。我们还进行了选择性研究,包括定性与一致性分析,以深入洞察该问题。

关键词

引用

@article{arxiv.2011.09159,
  title  = {Do Fine-tuned Commonsense Language Models Really Generalize?},
  author = {Mayank Kejriwal and Ke Shen},
  journal= {arXiv preprint arXiv:2011.09159},
  year   = {2020}
}

备注

9 pages, 2 figures