近似单头注意力如何学习
计算与语言
2021-10-22 v3 人工智能
摘要
为什么模型常常关注显著词,且这种关注在训练过程中如何演变?我们将模型训练近似为一个两阶段过程:训练早期当注意力权重均匀时,若输入词 `i` 与输出词 `o` 频繁共现,模型学会将单个输入词 `i` 翻译为 `o`。随后,由于模型已知 `i` 翻译为 `o`,它学会在正确输出为 时关注 `i`。为形式化描述,我们定义了一种模型属性——单字翻译知识(KTIW)(例如知道 `i` 翻译为 `o`),并声称它驱动了注意力的学习。该主张得到如下事实支持:在注意力机制被学会之前,KTIW 可从词共现统计中习得,反之则不然。特别地,我们可构造一种训练分布使 KTIW 难以学习,导致注意力学习失败,模型甚至无法学会将输入词复制到输出的简单任务。我们的近似解释了模型为何有时关注显著词,并启发了一个玩具示例:多头注意力模型可通过改善学习动态而非表达能力来克服上述困难训练分布。最后我们讨论了近似框架的局限性并给出未来方向。
引用
@article{arxiv.2103.07601,
title = {Approximating How Single Head Attention Learns},
author = {Charlie Snell and Ruiqi Zhong and Dan Klein and Jacob Steinhardt},
journal= {arXiv preprint arXiv:2103.07601},
year = {2021}
}