中文

合成数据生成的激活引导:多样性在下游安全检测中的作用

机器学习 2026-05-28 v1 计算与语言

摘要

安全检测模型需要帮助、无害、诚实 (HHH) 违反输出的示例才能实现稳健的泛化,但此类示例稀缺。激活引导 (AS) 作为一种数据高效的方法,已涌现出用于生成目标概念对齐响应。我们研究了 AS 是否能生成用于下游分类器的高质量训练数据集,这是一个尚未被测试的问题。我们进行了一项双重研究,涵盖 44 个概念 ×2\times\,2 个模型 ×4\times\,4 种引导方法的内在和外在评估。从内在方面,除了引导成功 (概念对齐) 和连贯性这两个领域标准 rubric 之外,我们引入样本和集合层面的多样性作为一个此前缺失于文献中的质量维度,发现增加引导强度会降低响应的多样性。从外在方面,我们用引导生成的数据替换可用训练数据中的 HHH 违反示例,并微调检测分类器。AS 生成的数据在 33 个概念上的分类器优于基于提示生成的数据。然而,只有 4141136136 个 AS 配置超过基于提示的方法,表明下游实用性落在一个狭窄的区间,该区间同时满足成功、连贯性和多样性。这三个轴的调和平均值比成功和连贯性alone 更一致地与下游 AUROC 相关,为实践者调整 AS 超参数提供了实用的启发目标。总体而言,我们的结果凸显了 AS 在提高安全检测合成数据生成潜力,同时识别了多样性作为调整 AS 的关键且此前被忽视的维度。

关键词

引用

@article{arxiv.2605.28664,
  title  = {Activation Steering for Synthetic Data Generation: The Role of Diversity in Downstream Safety Detection},
  author = {Vijeta Deshpande and Tootiya Giyahchi and Veena Padmanabhan and Leman Akoglu and Anna Rumshisky},
  journal= {arXiv preprint arXiv:2605.28664},
  year   = {2026}
}