小型语言模型能否学习、遗忘和保留噪声模式?
计算与语言
2025-05-28 v3 机器学习
摘要
随着在资源受限环境中对高效语言模型的需求日益增长,小型语言模型(SLM)已成为大语言模型(LLM)的紧凑且实用的替代方案。虽然有研究探讨了LLM中的噪声处理,但关于SLM如何处理噪声(这是其可靠实际部署的关键因素)知之甚少。本研究调查了参数在1到3亿之间的SLM学习、保留以及随后消除不同类型噪声(词翻转、字符翻转、音译、无关内容和矛盾信息)的能力。四个预训练的SLM(Olmo 1B、Qwen1.5 1.8B、Gemma1.1 2B和Phi2 2.7B)在无噪声数据上进行了指令微调,并通过上下文示例进行测试以评估噪声学习。随后,在指令微调中引入噪声模式以评估其适应性。结果揭示了模型处理噪声的差异,较小的模型如Olmo能快速适应噪声模式。Phi2经过精心策划、结构化和高质量的预训练数据使其能够抵抗字符级、音译和反事实噪声,而Gemma通过其多语言预训练成功适应了音译噪声。随后的干净数据训练有效地减轻了噪声影响。这些发现为开发用于实际应用的鲁棒SLM提供了实用策略。
引用
@article{arxiv.2407.00996,
title = {Can Small Language Models Learn, Unlearn, and Retain Noise Patterns?},
author = {Nicy Scaria and Silvester John Joseph Kennedy and Deepak Subramani},
journal= {arXiv preprint arXiv:2407.00996},
year = {2025}
}