中文

何时使用合成专利数据有效?体积-保真度在低资源多标签分类中的权衡

人工智能 2026-05-27 v2 信息检索

摘要

必须考虑的关于利用LLM生成的合成数据用于多标签专利分类的问题包括(i)何时可能有助于使用此类数据,以及(ii)为何如此。确实,后者部分恰当地调整以适应通过增加样本量来提高结果的可能性。当前实验涉及六个开源LLM(参数规模从3.8B到12B)用于分类中的四种真实数据情境,对64类WIPO标签(助力技术)进行分类。应用了完整合成生成(以标签集为条件)和改写方法,每种方法都与三个分类器类别结合使用。结果表明,BERT-for-Patents从0.120提升到0.702的微F1分数主要反映了体积效应;实际上,用165个示例的替换复制可得0.678。因此,相对于控制组的改进为+0.024,相对于最佳基线(焦点损失重加权)为+0.219。第二个关键要点是随数据生成情境变化而变化的保真度分数的演变。在低真实数据情境下,体积效应占主导,MMD与分类性能之间的相关系数为r = +0.95。随着真实数据的增加,相关性转为负相关,在1:10情境下达到r = -0.73(Fisher z = +6.47, p < 0.001, 95%置信区间Delta r [ +0.96, +1.00 ])。在固定预算分配下,将约20-30%的真实数据与70-80%的合成数据组合使用,优于纯合成和纯真实策略。此外,可能使分类性能提升至+0.58的语料库可能对Jaccard-重叠检索代理产生不利影响。其他作品的提示家族变体可能提供一些解释,但使用标准专利过滤器仍使nDCG@10下降26%。

关键词

引用

@article{arxiv.2605.24296,
  title  = {When Does Synthetic Patent Data Help? Volume-Fidelity Trade-offs in Low-Resource Multi-Label Classification},
  author = {Amirhossein Yousefiramandi and Ciaran Cooney},
  journal= {arXiv preprint arXiv:2605.24296},
  year   = {2026}
}