中文

面向生成式推荐的新词词元初始化

计算与语言 2026-04-03 v1 人工智能 机器学习

摘要

语言模型(LMs)正在扩展以添加新的可学习词元词汇,以适应特定于领域的任务,例如生成式推荐中的语义-ID词元。标准做法是将这些新的词元初始化为已有词汇嵌入的均值,然后依赖监督微调来学习其表示。我们对这一策略进行系统性分析:通过谱诊断和几何诊断,我们表明均值初始化会将所有新词元压缩到退化子空间中,消除了后续微调难以完全恢复的词元间差异。这些发现表明,词元初始化是扩展词汇时的关键瓶颈。受此诊断启发,我们提出“词元初始化假设”:在微调前将新词元语言学地锚定在预训练嵌入空间中,可更好地帮助模型利用其通用知识以应对新词元领域。我们将该假设实现为GTI(Grounded Token Initialization),一种轻量级锚定阶段,在微调前仅使用配对语言监督,将新词元映射到预训练嵌入空间中具有不同语义意义的位置。尽管其简单,GTI在多个生成式推荐基准(包括行业规模和公开数据集)的大多数评估设置下均优于均值初始化和现有辅助任务适应方法。进一步分析表明,锚定嵌入产生更丰富的词元间结构,且在微调过程中保持持久,这印证了词元初始化质量是词汇扩展关键瓶颈的假设。

关键词

引用

@article{arxiv.2604.02324,
  title  = {Grounded Token Initialization for New Vocabulary in LMs for Generative Recommendation},
  author = {Daiwei Chen and Zhoutong Fu and Chengming Jiang and Haichao Zhang and Ran Zhou and Tan Wang and Chunnan Yao and Guoyao Li and Rui Cai and Yihan Cao and Ruijie Jiang and Fedor Borisyuk and Jianqiang Shen and Jingwei Wu and Ramya Korlakai Vinayak},
  journal= {arXiv preprint arXiv:2604.02324},
  year   = {2026}
}