BPE如何影响Transformer中的记忆化
计算与语言
2021-12-03 v2
摘要
NLP中的训练数据记忆化既可能有益(例如闭卷问答)也可能有害(个人数据提取)。无论如何,成功的模型训练需要非平凡的记忆力来存储单词拼写、各种语言特异现象和常识。然而,关于是什么影响NLP模型的记忆行为知之甚少,因为该领域倾向于关注同样重要的泛化问题。在这项工作中,我们证明了字节对编码(BPE)学习的子词词汇表大小极大影响标准Transformer模型记忆训练数据的能力和倾向,即便我们控制了学习参数数量。我们发现,在较大的子词词汇表大小下,Transformer模型更容易拟合随机映射,并且更容易受到成员推断攻击。类似地,给定提示,具有较大子词词汇表的基于Transformer的语言模型更频繁地复现训练数据。我们推测该效应是由BPE词汇表增长时序列长度缩短引起的。我们的发现可支持对超参数更具依据的选择,从而更好地适配特定用例。
引用
@article{arxiv.2110.02782,
title = {How BPE Affects Memorization in Transformers},
author = {Eugene Kharitonov and Marco Baroni and Dieuwke Hupkes},
journal= {arXiv preprint arXiv:2110.02782},
year = {2021}
}