掩码与模仿:基于 AI 的作品鉴别攻击的战略隐蔽与冒充
计算与语言
2025-03-26 v1
摘要
人工智能技术(如大语言模型 LLM)的不断进步带来了诸多改进,包括对文档作品鉴别的准确识别。然而,尽管 LLM 改进了此类防御技术,也同时为恶意行为者提供了新的攻击向量。为遏制这一安全风险,我们评估了作品鉴别模型(具体为作品验证模型)对强大 LLM-based 攻击的对抗鲁棒性。这些攻击包括无针对性方法——作品隐蔽化——以及针对性方法——作品冒充。对于这两种攻击,目标是分别在保留原文语义的同时,掩盖或模仿作者的写作风格。因此,我们扰动了一个准确的作品鉴别模型,分别实现了约 92% 和 78% 的隐蔽化和冒充攻击成功率。
引用
@article{arxiv.2503.19099,
title = {Masks and Mimicry: Strategic Obfuscation and Impersonation Attacks on Authorship Verification},
author = {Kenneth Alperin and Rohan Leekha and Adaku Uchendu and Trang Nguyen and Srilakshmi Medarametla and Carlos Levya Capote and Seth Aycock and Charlie Dagli},
journal= {arXiv preprint arXiv:2503.19099},
year = {2025}
}
备注
Accepted at NLP4DH Workshop @ NAACL 2025