记忆制图:在神经机器翻译中描绘记忆—泛化连续统
计算与语言
2023-11-10 v1
摘要
训练神经网络时,它会迅速从数据集中记住某些源—目标映射,却始终学不会另一些。然而,记忆并不易作为一种非好即坏的二元特征来表达:单个数据点坐落于一条记忆—泛化连续统上。是什么决定了一个数据点在该谱系中的位置,且该谱系如何影响神经模型的性能?我们针对神经机器翻译(NMT)模型解答了这两个问题。我们利用反事实记忆度量来(1)构建一项将 500 万 NMT 数据点置于记忆—泛化地图上的资源,(2)阐明数据点的表层特征与模型的逐数据训练信号如何预测 NMT 中的记忆现象,(3)并描述该地图的子集对 NMT 系统性能的影响。
引用
@article{arxiv.2311.05379,
title = {Memorisation Cartography: Mapping out the Memorisation-Generalisation Continuum in Neural Machine Translation},
author = {Verna Dankers and Ivan Titov and Dieuwke Hupkes},
journal= {arXiv preprint arXiv:2311.05379},
year = {2023}
}
备注
Published in EMNLP 2023; 21 pages total (9 in the main paper, 3 pages with limitations, acknowledgments and references, 9 pages with appendices)