核抽样对缓解文本记忆效应的不合理无效性
计算与语言
2024-08-30 v1
摘要
本文分析了大型语言模型在施加核抽样后出现的文本记忆行为。核抽样等随机解码方法通常用于克服单调和重复的文本生成问题,而这些问题常出现在基于最大化的解码技术中。我们假设核抽样可能也能减少记忆模式的发生,因为它可能导致选择记忆序列之外的标记。为测试此假设,我们创建了一个包含已知重复物分布的诊断数据集,以便对某些训练数据部分的记忆概率进行控制。对两个在该数据集上微调的 GPT-Neo 模型的分析令人意外地表明:(i) 核大小的增加仅能略微减少记忆,(ii) 即使模型不进行“硬”记忆——即逐字复现训练样本——它们仍可能显示“软”记忆,即生成输出回响训练数据,但不完全呈现一对一的对应关系。
引用
@article{arxiv.2408.16345,
title = {The Unreasonable Ineffectiveness of Nucleus Sampling on Mitigating Text Memorization},
author = {Luka Borec and Philipp Sadler and David Schlangen},
journal= {arXiv preprint arXiv:2408.16345},
year = {2024}
}
备注
9 pages, Accepted at INLG 2024 (International Natural Language Generation Conference)