中文

面向短视频搜索相关性建模的细粒度相关性可控半监督合成数据生成

计算与语言 2025-12-05 v2

摘要

合成数据被广泛应用于嵌入模型,以确保训练数据分布在难度、长度和语言等维度上的多样性。然而,现有的基于提示的合成方法难以捕捉特定领域的数据分布,尤其是在数据稀缺的领域,并且常常忽略细粒度的相关性多样性。本文中,我们提出了一个具有4级相关性标注的中文短视频数据集,填补了一项关键资源空白。此外,我们提出了一种半监督合成数据流水线,其中两个协同训练的模型生成具有可控相关性标签的领域自适应短视频数据。我们的方法通过为代表性不足的中间相关性标签合成样本,增强了相关性级别的多样性,从而产生了一个更均衡、语义更丰富的训练数据集。大量离线实验表明,使用我们合成的数据训练的嵌入模型,其性能优于使用基于提示或普通监督微调(SFT)生成的数据训练的模型。此外,我们证明在训练数据中融入更多样化的细粒度相关性级别,可以增强模型对细微语义差异的敏感度,突显了细粒度相关性监督在嵌入学习中的价值。在抖音双列场景的搜索增强推荐流程中,通过在线A/B测试,所提出的模型将点击率(CTR)提升了1.45%,将强相关比例(SRR)提高了4.9%,并将图像用户渗透率(IUPR)提高了0.1054%。

关键词

引用

@article{arxiv.2509.16717,
  title  = {Semi-Supervised Synthetic Data Generation with Fine-Grained Relevance Control for Short Video Search Relevance Modeling},
  author = {Haoran Li and Zhiming Su and Junyan Yao and Enwei Zhang and Yang Ji and Yan Chen and Kan Zhou and Chao Feng and Jiao Ran},
  journal= {arXiv preprint arXiv:2509.16717},
  year   = {2025}
}

备注

Submitted to AAAI 2026