面向更优组合泛化的数据因素
计算与语言
2023-11-09 v1 人工智能
机器学习
摘要
近期关于组合泛化的诊断数据集,如SCAN(Lake and Baroni, 2018)与COGS(Kim and Linzen, 2020),暴露了在这些数据集上从零训练的模型的严重问题。然而,与这种糟糕表现相反,在更大量级且更通用的数据集上训练的最先进模型展现出更好的泛化能力。为调和这一不一致性,本文通过在具有不同数据因素(包括数据集规模、模式复杂度、样例难度等)的多种训练集上训练Transformer模型,开展实证分析。首先,我们表明增加数据集复杂度可在多种不同泛化挑战上带来更好的泛化行为。为进一步理解该提升,我们展示了更复杂数据集带来益处的两个维度:其提供了更多样化的样例,使组合理解更为有效;同时因降低了样例重复频率,也防止了对样例的不可泛化死记。最后,我们探究了不同难度水平的训练样例如何差异化地影响泛化。在合成数据集上,简单样例比困难样例引发更强的组合性。在更大规模真实语言数据集上,尽管困难样例可能因确保合理数据覆盖而变得更为重要,但简单与困难样例的平衡混合却能诱导出最强的可泛化性。本工作的代码与数据见https://github.com/owenzx/data4comp
引用
@article{arxiv.2311.04420,
title = {Data Factors for Better Compositional Generalization},
author = {Xiang Zhou and Yichen Jiang and Mohit Bansal},
journal= {arXiv preprint arXiv:2311.04420},
year = {2023}
}
备注
EMNLP 2023 (18 pages)