面向语言学的动机数据增强值得吗?
计算与语言
2025-06-05 v1
摘要
数据增强是一种广泛使用的应对数据稀缺的技术,涉及生成合成数据示例,然后用于增强可用训练数据。研究人员从简单方法中取得了令人惊讶的成功,例如从自然示例进行随机扰动,模型似乎从包含无意义词汇或不符合语言规则的数据中也能受益。第二条研究路线生成确实遵循所有语言学约束的合成数据;这些方法需要一定的语言学专业知识,并且通常更难实现。此前尚无工作对语言学朴素和语言学动机两种数据增强策略进行系统的实证比较,使得语言学动机数据增强是否真的能带来更好的下游性能仍不确定。在本工作中,我们对两种具有不同形态学属性的低资源语言——Uspanteko和Arapaho——的增强策略(语言学朴素和语言学动机)进行了仔细全面的比较。我们在两个对低资源语言重要的序列到序列任务上评估了许多不同策略及其组合的有效性:机器翻译和逐词注释。我们发现语言学动机策略相对于朴素方法具有优势,但仅当它们生成的新示例与训练数据分布没有显著不同时。
引用
@article{arxiv.2506.03593,
title = {Is linguistically-motivated data augmentation worth it?},
author = {Ray Groshan and Michael Ginn and Alexis Palmer},
journal= {arXiv preprint arXiv:2506.03593},
year = {2025}
}
备注
Accepted to ACL 2025 Main. First two authors contributed equally