极限视角下的动态对抗训练数据分析
计算与语言
2022-09-28 v2 机器学习
摘要
为创建在广泛测试输入上鲁棒的模型,训练数据集应包含涵盖众多现象的不同示例。动态对抗数据收集(dynamic adversarial data collection, DADC)由标注者构造挑战持续改进的模型的示例,作为生成此类多样训练集的方法颇具前景。已有工作表明,运行 1-3 轮 DADC 可帮助模型修正部分错误类型,但不一定带来超越对抗测试数据的更好泛化。我们主张多轮运行 DADC 可最大化其训练期收益,因为不同轮次可共同覆盖许多任务相关现象。我们呈现了首个更长期 DADC 研究,针对一小组前提段落收集 20 轮 NLI 示例,含对抗与非对抗方法。在 DADC 示例上训练的模型相较非对抗数据训练的模型在我们的专家整理测试集上少犯 26% 的错误。分析显示,与非对抗示例相比,DADC 产生的示例更难、词汇与句法更多样,且含更少标注伪迹。
引用
@article{arxiv.2110.08514,
title = {Analyzing Dynamic Adversarial Training Data in the Limit},
author = {Eric Wallace and Adina Williams and Robin Jia and Douwe Kiela},
journal= {arXiv preprint arXiv:2110.08514},
year = {2022}
}
备注
ACL Findings 2022