Algospeak 的公开隐匿:可读意义与规避检测之间的权衡
计算与语言
2026-05-08 v1 计算机与社会
摘要
随着大型语言模型 (LLM) 日益介入内容生成与审核,被称为 Algospeak 的语言规避策略加剧了规避者与检测者之间的协同演化。本研究将基于联合行动模型的底层动力学形式化:当 Algospeak 增加时,可检测性和可理解性随之下降。此外,引入了多数可理解调制 (Majority Understandable Modulation, MUM) 的概念,并将其定义为在该调制水平下,额外的规避性修改虽能增加对检测器的规避,却会使大多数接收者丧失理解力。为了实证探究这一权衡,我们引入了一个可复现的框架,该框架基于现有的分类法并具有可调的调制水平,可用于生成保持原意且具有 Algospeak 风格的变体。以 COVID-19 虚假信息作为首个示例证明场景,我们构建了一个包含 700 个调制项的参考数据集,这些项提取自 20 个基础句子,涵盖 5 个调制水平和 7 种策略。随后,我们使用七个不同的语言模型进行了两项关联评估:一项通过意义恢复测试解释能力,另一项通过分类测试虚假信息检测能力。对调制水平进行曲线拟合得出了多数可理解调制阈值的估计值,并实现了跨策略和模型的敏感性分析,见图 1。结果揭示了可理解性与调制之间的特征关系。本研究为理解 Algospeak 背后的动力学奠定了基础,并提供了所描述的框架、数据集和实验设置。
引用
@article{arxiv.2605.06619,
title = {Algospeak, Hiding in the Open: The Trade-off Between Legible Meaning and Detection Avoidance},
author = {Jan Fillies and Ronald E. Robertson and Jeffrey Hancock},
journal= {arXiv preprint arXiv:2605.06619},
year = {2026}
}
备注
Under Review