中文

搭建冷启动鸿沟:基于大型语言模型的自然语言搜索合成数据生成

信息检索 2026-05-22 v1

摘要

部署自然语言搜索系统面临一个关键的冷启动挑战:没有真实用户查询来学习语言模式,没有相关性标签来训练排序模型。我们提出一个框架,使用大型语言模型(LLM)生成合成查询和标签,为Airbnb的自然语言搜索提供模型训练和评估。对于查询生成,我们将预订 session 中的对比性 listing 配对与用户研究中的 seed 查询相结合,以平衡真实性和多样性,实现从冷启动到温启动的过渡,作为真实用户数据的可用性。对于标签生成,我们引入对比生成,通过构造产生主题标签,并引入Virtual Judge(VJ)标签以获得更广泛的覆盖。我们将方法与无 seed 对比基线和InPars风格的基线进行比较。对于查询长度,InPars基线产生冗长查询,其KL散度为12.03,而我们的 seed 引导方法 achieves 0.66,提升了7.5倍。对于属性类型分布,我们的方法实现了最低的KL散度(0.04),甚至优于 seed 查询(0.09)。实验表明,我们的方法比无 seed 基线产生更具挑战性的评估示例(79% vs. 97%两两准确率),为模型改进提供了判别性信号。我们在生产管道中部署了每日生成合成示例的系统,用于基于嵌入的检索和排序评估。

关键词

引用

@article{arxiv.2605.21812,
  title  = {Bridging the Cold-Start Gap: LLM-Powered Synthetic Data Generation for Natural Language Search at Airbnb},
  author = {Wendy Ran Wei and Hao Li and Weiwei Guo and Xiaowei Liu and Xueyin Chen and Dillon Davis and Malay Haldar and Soumyadip Banerjee and Kedar Bellare and Huiji Gao and Stephanie Moyerman and Sanjeev Katariya},
  journal= {arXiv preprint arXiv:2605.21812},
  year   = {2026}
}