中文

NodeSynth:用于 AI 评估的社会对齐合成数据

机器学习 2026-05-19 v2 计算与语言

摘要

生成式 AI 的最新进展促进了用于模型评估的大规模合成数据生成。然而,如果没有针对性的方法,这些数据集通常缺乏敏感领域所需的社会技术细微差别。我们引入了 NodeSynth,这是一种以证据为基础的方法,通过利用基于现实世界证据微调的分类法生成器(taxonomy generator, TaG)来生成具有社会相关性的合成查询。在四个主流 LLM(例如 Claude 4.5 Haiku)上进行评估时,NodeSynth 引发的失败率比人类编写的基准高出五倍。消融研究证实,我们细粒度的分类扩展显著推动了这些失败率,而独立验证揭示了著名护栏模型(例如 Llama-Guard-3)中的关键缺陷。我们开源了端到端的研究原型和数据集,以实现可扩展的高风险模型评估和针对性的安全干预(https://github.com/google-research/nodesynth)。

关键词

引用

@article{arxiv.2605.14381,
  title  = {NodeSynth: Socially Aligned Synthetic Data for AI Evaluation},
  author = {Qazi Mamunur Rashid and Xuan Yang and Zhengzhe Yang and Yanzhou Pan and Erin van Liemt and Darlene Neal and Kshitij Pancholi and Jamila Smith-Loud},
  journal= {arXiv preprint arXiv:2605.14381},
  year   = {2026}
}