Transformer 模型跨时间与规模的逐字上下文检索研究
计算与语言
2024-11-12 v1
摘要
为预测后续文本,语言模型在某些情况下必须逐字检索上下文信息。本报告研究了语言模型检索任意上下文名词的能力在训练过程中(跨时间)以及随着模型在相同数据集上规模增大(跨规模)时的发展情况。我们进一步探讨上下文检索的学习是否与更具挑战性的零样本基准学习相关。此外,受人类短时记忆语义效应启发,我们根据目标名词的一个主要语义成分——即它们指代具体还是抽象实体(由人类评定)——来评估检索表现。我们发现,逐字上下文检索在训练早期经历突变式发展,约在 1% 训练 token 后出现。这一现象跨越模型规模(从 14M 到 12B 参数)均被观测到,且两个最小模型的转变略晚发生。我们进一步发现,逐字上下文检索的发展与零样本基准的学习呈正相关。在转变点附近,所有模型均表现出检索具体名词优于抽象名词的优势。除两个最小模型外,这种优势在训练后期逐渐消失。
引用
@article{arxiv.2411.07075,
title = {Transformer verbatim in-context retrieval across time and scale},
author = {Kristijan Armeni and Marko Pranjić and Senja Pollak},
journal= {arXiv preprint arXiv:2411.07075},
year = {2024}
}
备注
accepted to Conference on Natural Language Learning 2024 (https://www.conll.org/)