将新词学习作为微调的参数组高效替代方案用于模型引导
计算与语言
2025-12-23 v1
摘要
在语言建模中,新词是为表示模型词汇表中尚未包含的概念而训练的新词标记。新词可用于鼓励模型 exhibit特定行为,例如通过附加“Give me a neologism answer.”的提示来实现。通过微调也可实现行为引导,但计算资源更多且灵活性较低:学习新词仅训练d个参数,允许用户仍访问模型的默认行为。我们将新词学习与低秩适应(LoRA)微调进行比较,发现新词在匹配的训练设置下(相同数据和超参数)优于微调模型。我们还研究了新词的自 verbalizations,观察到模型偶尔会为新词自行发明自己的新词。
引用
@article{arxiv.2512.18551,
title = {Neologism Learning as a Parameter-Efficient Alternative to Fine-Tuning for Model Steering},
author = {Sungjoon Park and Varun Ramamurthi and Owen Terry},
journal= {arXiv preprint arXiv:2512.18551},
year = {2025}
}