面向生成式推荐的可变长度分词学习
统计理论
2026-05-19 v1 机器学习
统计方法学
机器学习
统计理论
摘要
生成式推荐将推荐问题 reformulate 为离散语义标识(IDs)的下一个标记预测。一个尚未被充分探索的基本设计选择是,现有方法为所有物品采用固定长度分词,隐式假设其编码容量与物品特征无关。通过在四个数据集上的系统性实验,我们发现流行物品可用短 ID 实现最佳性能,而长尾物品则需要显著更长的代码来捕获判别性语义。这揭示了一个关键矛盾:流行物品依赖丰富的协同信号,所需语义细节有限;而长尾物品因稀疏交互数据,必须依赖精细的内容特征。为此,我们提出了VarLenRec,一个学习可变长度分词的框架。我们发展了 Popularity-Weighted Information Budget Allocation(PIBA),一个信息论框架,证明最佳 ID 长度应随流行度的负幂函数增长。直接实现可变长度分配面临两个技术挑战:标准欧几里得残差量化缺乏几何容量支持不同代码长度且不易产生失真;离散长度决策不可微。我们通过 Hyperbolic Residual Quantization 利用庞朗球的指数体积增长自然分层编码容量,通过 Soft Length Controller 实现连续层保留概率的可微长度预测,并以 PIBA 派生的先验进行正则化。广泛的实验表明,VarLenRec 在推荐准确率和训练/推理效率方面均显著优于最新方法,揭示了生成式推荐中自适应编码容量的重要性。
引用
@article{arxiv.2605.17778,
title = {Self-Distillation is Optimal Among Spectral Shrinkage Estimators in Spiked Covariance Models},
author = {Radu Lecoiu and Debarghya Mukherjee and Pragya Sur},
journal= {arXiv preprint arXiv:2605.17778},
year = {2026}
}
备注
103 pages, 8 figures