Anecdoctoring:跨语言与地域的自动化红队评估
计算与语言
2025-09-24 v1 人工智能
计算机与社会
摘要
虚假信息是生成式人工智能(AI)滥用的首要风险之一。生成式 AI 的全球普及要求红队评估(即系统性对抗性探测)在不同语言和文化间具有鲁棒性,但红队评估数据集通常以美国和英语为中心。为了填补这一空白,我们提出了“anecdoctoring”,一种跨语言和文化自动生成对抗性提示的新型红队评估方法。我们从三个语言(英语、西班牙语和印地语)和两个地理区域(美国和印度)的事实核查网站收集虚假信息声明。然后,我们将各个声明聚类为更广泛的叙事,并用知识图谱刻画所得聚类,以此增强攻击者 LLM。与少样本提示相比,我们的方法产生了更高的攻击成功率,并提供了可解释性优势。结果强调了在全球范围内扩展虚假信息缓解措施并将其立足于现实世界对抗性滥用的必要性。
引用
@article{arxiv.2509.19143,
title = {Anecdoctoring: Automated Red-Teaming Across Language and Place},
author = {Alejandro Cuevas and Saloni Dash and Bharat Kumar Nayak and Dan Vann and Madeleine I. G. Daepp},
journal= {arXiv preprint arXiv:2509.19143},
year = {2025}
}
备注
To be published in EMNLP 2025