语义解析中的组合泛化:预训练 vs. 专用架构
计算与语言
2021-09-23 v3 机器学习
摘要
尽管主流机器学习方法已知在组合泛化方面能力有限,但新的架构与技术仍在不断被提出以应对该局限。我们调研了最先进的技术与架构,以评估其在基于 SCAN 和 CFQ 数据集的语义解析任务中改进组合泛化的有效性。我们表明,掩码语言模型(MLM)预训练在原始留出分割上可与受 SCAN 启发的架构相媲美。在更复杂的组合任务上,我们表明预训练相较可比的非预训练模型带来了显著的性能提升,而旨在鼓励 SCAN 上或算法学习领域组合泛化的架构未能带来显著改进。我们利用 MLM 预训练结合一种中间表示,在 CFQ 组合泛化基准上确立了新的最先进水平。
引用
@article{arxiv.2007.08970,
title = {Compositional Generalization in Semantic Parsing: Pre-training vs. Specialized Architectures},
author = {Daniel Furrer and Marc van Zee and Nathan Scales and Nathanael Schärli},
journal= {arXiv preprint arXiv:2007.08970},
year = {2021}
}