当更多数据有害时:开发广覆盖自然语言理解系统中的一个令人困扰的怪象
计算与语言
2022-11-09 v2
摘要
在自然语言理解(NLU)生产系统中,用户不断变化的需求要求随时间添加新功能,这些功能由意义表示空间中新增的符号索引。这需要额外的训练数据,并导致数据集不断增长。我们首次对该增量符号学习场景进行了系统研究。我们的分析揭示了构建广覆盖NLU系统中的一个令人困扰的怪象:如果我们不相应增加新符号的训练数据,随着训练数据集增大,新符号上的性能往往会下降。这表明使用更大的训练数据集学习新符号变得更加困难。我们展示了这一趋势在两项常见NLU任务(意图识别和语义解析)上的多种主流模型中均成立。在排除类别不平衡作为唯一原因后,我们揭示该趋势与我们称之为源信号稀释的效应密切相关,即随着训练数据集增大,新符号的强词汇线索被稀释。有选择地丢弃训练样本以防止稀释通常能逆转该趋势,显示出主流神经NLU模型对简单词汇线索的过度依赖。代码、模型和数据可在 https://aka.ms/nlu-incremental-symbol-learning 获取。
引用
@article{arxiv.2205.12228,
title = {When More Data Hurts: A Troubling Quirk in Developing Broad-Coverage Natural Language Understanding Systems},
author = {Elias Stengel-Eskin and Emmanouil Antonios Platanios and Adam Pauls and Sam Thomson and Hao Fang and Benjamin Van Durme and Jason Eisner and Yu Su},
journal= {arXiv preprint arXiv:2205.12228},
year = {2022}
}
备注
EMNLP 2022