数据划分策略对模型泛化能力的影响:以形态学分割为例
计算与语言
2024-04-16 v1
摘要
近期旨在通过增强数据划分策略以实现更真实模型评估的研究,在提供明确的最优选择方面面临挑战。本研究针对这些挑战,聚焦于形态学分割,并综合分析了与语言多样性、采用多个数据集与划分以及详细模型比较相关的局限性。我们的研究利用了来自10个语系19种语言的数据,其中包括10种具有多样形态系统(多式综合语、融合语和黏着语)且数据可用性程度不同的原住民或濒危语言。我们使用不同规模的训练集与评估集组合以及新测试数据进行了大规模实验。结果表明,在面对新测试数据时:(1) 基于随机划分训练的模型能够获得更高的数值分数;(2) 由随机划分得出的模型排名往往能更一致地泛化。
引用
@article{arxiv.2404.09371,
title = {The Effect of Data Partitioning Strategy on Model Generalizability: A Case Study of Morphological Segmentation},
author = {Zoey Liu and Bonnie J. Dorr},
journal= {arXiv preprint arXiv:2404.09371},
year = {2024}
}
备注
Accepted to 2024 Annual Conference of the North American Chapter of the Association for Computational Linguistics (16 pages including 9 tables and 1 figure)