人类对抗性与亲和性样本对 BERT 泛化的影响
人工智能
2023-12-12 v4
摘要
基于 BERT 的模型在排行榜上表现强劲,但在需要泛化的真实场景中被证明更差。训练数据数量有限被视为机器学习中实现可泛化性的关键障碍。本文中,我们考察训练数据质量(而非数量)对模型可泛化性的影响。我们考虑训练数据的两个特征:人类对抗性(h-adversarial)样本比例,即看似差异微小但真实标签不同的样本对;以及人类亲和性(h-affable)训练样本,即差异微小但真实标签相同的样本对。我们发现,在固定训练样本规模下,作为经验法则,含有 10–30% 的 h-adversarial 实例可使文本分类与关系抽取任务的精确率乃至 F1 提升多达 20 个点。超出该范围增加 h-adversarials 可能导致性能平台期甚至下降。相比之下,h-affables 可能无助于模型泛化,甚至可能降低泛化性能。
引用
@article{arxiv.2310.08008,
title = {Effects of Human Adversarial and Affable Samples on BERT Generalization},
author = {Aparna Elangovan and Jiayuan He and Yuan Li and Karin Verspoor},
journal= {arXiv preprint arXiv:2310.08008},
year = {2023}
}
备注
To appear at EMNLP Findings 2023