中文

对抗竞技场:通过交互竞赛进行数据 crowdsourcing

人工智能 2026-04-21 v1 机器学习

摘要

后训练大型语言模型需要多样化、高质量的数据,而在低资源领域和多轮对话场景中,这类数据稀缺且获取成本高昂。常见的解决方案包括 crowdsourcing 或合成数据生成,但两者往往产生低质量或低多样性的数据。我们提出对抗竞技场(Adversarial Arena)通过将数据生成建模为对抗任务来构建高质量对话数据集:攻击者创建提示词,防御者生成响应。这种由多个团队在交互式竞争中自然产生多样且复杂的数据。我们通过邀请来自美国和欧洲顶尖大学的 10 个学术团队参与竞赛,每个团队构建攻击者或防御者机器人,来验证这一方法。该竞赛聚焦于 LLM 在网络安全领域的安全对齐,生成了 19,683 轮多轮对话。对该数据集进行微调后,模型在 CyberSecEval-Instruct 上的安全代码生成性能提升了 18.47%,在 CyberSecEval-MITRE 上的提升达到 29.42%。

关键词

引用

@article{arxiv.2604.17803,
  title  = {Adversarial Arena: Crowdsourcing Data Generation through Interactive Competition},
  author = {Prasoon Goyal and Sattvik Sahai and Michael Johnston and Hangjie Shi and Yao Lu and Shaohua Liu and Anna Rumshisky and Rahul Gupta and Anna Gottardi and Desheng Zhang and Lavina Vaz and Leslie Ball and Lucy Hu and Luke Dai and Samyuth Sagi and Maureen Murray and Sankaranarayanan Ananthakrishnan},
  journal= {arXiv preprint arXiv:2604.17803},
  year   = {2026}
}

备注

10 pages, 3rd DATA-FM workshop @ ICLR 2026