透过帷幕一瞥:利用绕步提示工程识别生成式AI模型中的偏见与虚假信息
计算机与社会
2026-01-23 v2
摘要
本研究探讨了生成式AI研究中兴起的绕步提示工程技术,这是一种故意绕过AI安全措施以暴露生成式AI模型底层偏见和脆弱性的方法。我们讨论了互联网来源的训练数据如何将意外偏见和虚假信息引入AI系统,而这些偏见和虚假信息可通过谨慎应用绕步技术加以揭示。借鉴网络安全中的红队测试思路,我们论证了绕步提示在识别和应对潜在漏洞方面的重要作用,同时承认其作为研究工具和潜在安全威胁的双重性质。我们的发现揭示了三个关键启示:(1)尽管经过内容过滤,互联网来源的偏见在AI训练数据中仍然持续存在;(2)绕步技术在负责任使用时能有效暴露这些偏见;(3)需要针对这些方法的恶意应用建立稳健的防护措施。我们最后提出了一个在AI研究与开发中使用绕步提示的伦理框架,强调在系统改进与安全考量之间保持平衡的重要性。
引用
@article{arxiv.2503.15205,
title = {A Peek Behind the Curtain: Using Step-Around Prompt Engineering to Identify Bias and Misinformation in GenAI Models},
author = {Don Hickerson and Mike Perkins},
journal= {arXiv preprint arXiv:2503.15205},
year = {2026}
}
备注
v2 correction of errata