FLUID:从短暂 ID 到工业规模直播的多模态语义代码
人工智能
2026-05-28 v2
摘要
现代推荐系统高度依赖基于 ID 的协同过滤:每个物品由唯一的 ID 嵌入表示,累积来自用户交互的协同信号。直播推荐然而面临这个范式下的独特挑战:直播间通常仅播出几十分钟,其物品 ID 处于持续的冷启动状态,ID 导向的排序模型难以泛化。我们提出 FLUID,首个在生产规模的直播排行榜中完全淘汰候选方物品 ID 的框架。FLUID 引入一个跨域多模态编码器,联合训练短视频和直播,以产生离散层次语义代码,称为 LUCID,用于基于内容的物品特征描述。为适配排行榜,FLUID 进一步采用分阶段热身方案:首先将冷的、切片级 LUCID 作为独立 token 融入 ID 嵌入,随后在在线增量训练前将 ID 嵌入替换为温暖的、房间级 LUCID。该系统已部署在拥有全球一亿用户的跨平台工业级直播推荐系统中,FLUID 实现了 +0.55% 的观看时长提升、+2.05% 的冷启动房间观看量提升和 +0.05% 的活跃时长提升。
引用
@article{arxiv.2605.21832,
title = {FLUID: From Ephemeral IDs to Multimodal Semantic Codes for Industrial-Scale Livestreaming Recommendation},
author = {Xinhang Yuan and Zexi Huang and Anjia Cao and Xudong Lu and Zikai Wang and Penghao Zhou and Chang Liu and Wentao Guo and Qinglei Wang},
journal= {arXiv preprint arXiv:2605.21832},
year = {2026}
}