基于域适应与可扩展性的密集检索内容推荐
摘要
电商推荐和搜索通常依赖稀疏关键词匹配(如 BM25),当用户意图与产品元数据词汇重叠有限时会失效。我们将基于内容的推荐建模为检索任务:给定自然语言意图信号(查询或评论),通过语义相似性从大型目录中检索出最相关的 K 个物品。我们提出了一个基于双塔双编码器的可扩展密集检索系统,使用有监督对比学习和 Multiple Negatives Ranking Loss 在 Amazon Reviews 2023(时尚)子集上进行微调。我们从评论文本(作为查询代理)和物品元数据(作为正文档)构建训练对,并在 50,000 条抽样交互上进行微调,最大序列长度为 500。为了高效部署,我们将 FAISS HNSW 索引与 ONNX Runtime 推理管道结合使用,采用 INT8 动态量化。在针对 826,402 个目录物品的评论到标题基准测试中,我们的方法将 Recall@10 从 0.26(BM25)提升至 0.66,同时满足实际的延迟和模型大小约束:CPU 上中位数推理延迟为 6.1 毫秒(批量大小为 1),模型大小降低 4 倍。总体而言,我们提供了一个从离线训练到 CPU 高效部署的端到端、可复现的域适应密集检索蓝图。
关键词
引用
@article{arxiv.2602.00899,
title = {Domain-Adaptive and Scalable Dense Retrieval for Content-Based Recommendation},
author = {Mritunjay Pandey},
journal= {arXiv preprint arXiv:2602.00899},
year = {2026}
}
备注
13 pages, 4 figures. Semantic dense retrieval for content-based recommendation on Amazon Reviews 2023 (Category - Fashion). Dataset statistics: 2.0M users; 825.9K items; 2.5M ratings; 94.9M review tokens; 510.5M metadata tokens. Timespan: May 1996 to September 2023. Metadata includes: user reviews (ratings, text, helpfulness votes, etc.); item metadata (descriptions, price, raw images, etc.)