中文

Aug2Search:利用 LLM 生成的合成数据增强 Facebook Marketplace 搜索

信息检索 2025-06-26 v3 计算与语言

摘要

基于嵌入的检索(Embedding-Based Retrieval, EBR)是现代搜索引擎中的重要技术,能够实现搜索查询与相关结果之间的语义匹配。然而,类似 Facebook Marketplace 这样的平台的搜索日志数据缺乏足够的多样性和细节,以有效训练 EBR 模型,从而限制了模型捕捉细致搜索模式的能力。为解决这一挑战,我们提出了 Aug2Search,一种基于 EBR 的框架,利用生成式人工智能(GenAI)模型生成的合成数据,在多模态和多任务方法下优化查询-产品相关性。本文探讨了 GenAI,特别是大语言模型(LLM)在生成高质量合成数据方面的能力,以及其对增强 EBR 模型产生影响的作用。我们使用八个 Llama 模型和来自 Facebook Marketplace 日志的 1000 万数据点进行实验。我们的合成数据生成遵循三种策略:(1)生成查询;(2)增强产品列表;(3)从增强后的列表生成查询。我们在三个不同的数据集上训练 EBR 模型:抽样的互动数据或原始数据(例如“点击”和“列表互动”)、合成数据,以及两种互动和合成数据的混合数据,以评估其在各种训练集中的性能。我们的发现表明,Llama 模型在生成具有高一致性、相关性和多样性的合成查询和列表方面表现稳健,同时保持较低的幻觉水平。Aug2Search 在 1000 万合成数据样本下实现了最高可达 4% 的 ROC_AUC 提升,证明了我们方法的有效性。此外,我们的实验结果表明,在相同的数据量下,仅使用合成数据训练的模型通常优于仅使用原始数据或原始数据和合成数据混合训练的模型。

关键词

引用

@article{arxiv.2505.16065,
  title  = {Aug2Search: Enhancing Facebook Marketplace Search with LLM-Generated Synthetic Data Augmentation},
  author = {Ruijie Xi and He Ba and Hao Yuan and Rishu Agrawal and Yuxin Tian and Ruoyan Kong and Arul Prakash},
  journal= {arXiv preprint arXiv:2505.16065},
  year   = {2025}
}