超越静态基准:基于人设驱动的仿真合成有害内容以实现稳健评估
计算与语言
2026-04-21 v1 人工智能
摘要
静态基准测试在可扩展性和多样性方面存在局限,可能受到网络大规模预训练语料的污染影响。为此,我们提出了一个合成有害内容的框架,利用人设引导的大语言模型(LLM)智能体。我们的方法通过整合人口统计身份和主题兴趣与情境有害策略,构建二维用户人设,实现对多样且情境依赖性强的有害交互的仿真。我们沿用三个维度对该框架进行评估:有害性、挑战性和多样性。人类和基于LLM的评估均确认,该框架实现了高比例的有害生成成功率。跨多个检测系统的实验表明,我们合成的情景比现有基准测试更具检测挑战性。此外,多方位分析确认,我们的方法在语言和主题多样性方面,相当于人类精选数据集,确立了该框架作为稳健压力测试有害内容检测系统的有效工具。
引用
@article{arxiv.2604.17020,
title = {Beyond Static Benchmarks: Synthesizing Harmful Content via Persona-based Simulation for Robust Evaluation},
author = {Huije Lee and Jisu Shin and Hoyun Song and Changgeon Ko and Jong C. Park},
journal= {arXiv preprint arXiv:2604.17020},
year = {2026}
}
备注
ACL 2026