中文

生产级检索增强型商业推荐中的释义脆弱性:低于重跑稳定性基线的可重复性

信息检索 2026-05-28 v1 人工智能

摘要

买家提问方式的微小变化——“最佳CRM”vs“顶级CRM”vs“适合SaaS初创公司的最佳CRM”——会导致AI助手给出截然不同的品牌推荐。在OpenAI和Anthropic模型上进行的约6,000次释义运行和约6,000次相同提示词重跑对照中,相同潜在购买意图的两个释义之间的推荐集相似度(Jaccard)对于措辞改写(聚类95% CI [0.215, 0.361])为0.288,对于添加约束的改写([0.098, 0.175],合并区域/语言和特异性阶梯轴)为0.135——两者都远低于0.50-0.61的相同提示词重跑基线。提示词字符串,而非潜在买家意图,是决定哪些品牌出现的主导输入。增加推理努力并不能缩小差距(界限为+/-0.05)。这对日益流行的AEO/GEO实践构成了直接挑战。通过统计一组固定提示词中的品牌提及次数来追踪品牌的“AI可见性”,会产生一个指标,其方差的主要来源是追踪器恰好发出的释义,而非模型对该品牌的行为:相同买家意图的两个自然释义产生的推荐集Jaccard重叠率为14-29%,而相同提示词重跑的重叠率为50-61%。原则上,对每个意图采样更多释义可以减少这种伪影,并且学术界存在高效的多提示词评估方法,但自然买家措辞空间远大于这些方法已验证的基准规模提示词集,也远超任何商业追踪器为每个品牌-意图组合发出的提示词数量。因此,逐提示词的提及追踪作为测量单位在结构上是不稳定的;有意义的改进可能需要一个不同的单位,而非更大的提示词集。

关键词

引用

@article{arxiv.2605.27440,
  title  = {Paraphrase Brittleness in Production Retrieval-Augmented Commercial Recommendation: Reproducibility Below the Rerun-Stability Baseline},
  author = {Will Jack and Noah Lehman and Keller Maloney and Sarah Xu},
  journal= {arXiv preprint arXiv:2605.27440},
  year   = {2026}
}