面向生成式推荐的可变长度分词学习
机器学习
2026-05-19 v1
摘要
生成式推荐将推荐问题 reformulate 为在离散语义标识符(IDs)上的下一标记预测。一个基本却未被充分探索的设计选择是,现有方法为所有物品采用固定长度分词,隐含地假设编码容量与物品特征无关。通过在四个数据集上的系统性实验,我们发现“流行度-长度悖论”:流行物品在短ID上实现最佳性能,而长尾物品需要更长的代码来捕获判别性语义。这揭示了一个关键性失配:流行物品受益于丰富的协同信号,所需语义细节有限;而长尾物品必须依赖精细的内容特征,因为交互数据稀疏。为解决此问题,我们提出VarLenRec,一个用于学习可变长度分词的框架。我们发展了基于流行度加权信息预算分配(PIBA)的信息论框架,证明最佳ID长度应随流行度的负幂函数而增长。直接实现可变长度分配面临两个技术挑战:标准欧几里得残差量化缺乏几何容量以无失真地支持多样化的代码长度;离散长度决策不可微。我们通过双曲残差量化利用庞朗球的指数体积增长来自然分层编码容量,通过软长度控制器实现通过连续层保留概率实现可微长度预测,并以PIBA衍生的先验进行正则化。大量实验表明,VarLenRec在推荐准确性和训练/推理效率方面均显著优于最先进的方法,揭示了自适应编码容量在生成式推荐中的重要性。
引用
@article{arxiv.2605.17779,
title = {Learning Variable-Length Tokenization for Generative Recommendation},
author = {Minhao Wang and Bowen Wu and Wei Zhang},
journal= {arXiv preprint arXiv:2605.17779},
year = {2026}
}
备注
13 pages, 5 figures