中文

TF-DCon:利用大语言模型赋能基于内容的推荐中无训练数据集浓缩

信息检索 2025-02-11 v5

摘要

现代基于内容的推荐(CBR)技术利用物品内容信息为用户提供个性化服务,但在大规模数据集上的训练资源密集。为解决此问题,本文探索文本 CBR 的数据集浓缩。数据集浓缩的目标是合成一个小型但信息丰富的数据集,基于该数据集训练的模型可达到与在大型数据集上训练相当的性能。现有浓缩方法专为图像或嵌入等连续数据的分类任务设计,直接应用于 CBR 存在局限。为弥补这一差距,我们研究面向基于内容推荐的的高效数据集浓缩。受大语言模型(LLMs)在文本理解与生成方面卓越能力的启发,我们利用 LLMs 赋能浓缩过程中文本内容的生成。为处理涉及用户与物品的交互数据,我们设计了一种双层级浓缩方法:内容级与用户级。在内容级,我们利用 LLMs 将物品的所有内容浓缩为一个新的信息丰富标题。在用户级,我们设计了一个基于聚类的合成模块,首先利用 LLMs 提取用户兴趣,然后将用户兴趣与用户嵌入结合以浓缩用户并为浓缩后的用户生成交互。值得注意的是,该方法的浓缩范式是前向的,且无需对合成数据集进行迭代优化。我们在三个真实数据集上的大量实证结果证实了所提方法的有效性。特别地,我们能在将数据集规模缩减 95% 的同时逼近原始性能达 97%(即在 MIND 数据集上)。

关键词

引用

@article{arxiv.2310.09874,
  title  = {TF-DCon: Leveraging Large Language Models (LLMs) to Empower Training-Free Dataset Condensation for Content-Based Recommendation},
  author = {Jiahao Wu and Qijiong Liu and Hengchang Hu and Wenqi Fan and Shengcai Liu and Qing Li and Xiao-Ming Wu and Ke Tang},
  journal= {arXiv preprint arXiv:2310.09874},
  year   = {2025}
}

备注

Full version of TheWebConf'25 accepted paper