中文

文本到图像模型留下可识别签名:面向 leaderboard 安全的影响

机器学习 2025-10-09 v1 密码学与安全

摘要

生成式 AI leaderboard 是评估模型能力的核心,但仍面临操纵风险。其中关键的对手目标是排名操纵,攻击者必须首先识别显示输出背后的模型——这一威胁此前已被证实并探索于大型语言模型 (LLM)。我们展示这一问题对文本到图像 leaderboard 更为严重,因而识别模型更为容易。使用超过 15 万张来自 280 个提示和 19 个不同组织、架构和规模模型生成的图像,我们演示即使无需提示控制或历史数据,简单实时的 CLIP 嵌入空间分类也能高准确率识别生成模型。我们进一步引入提示级别的可分离性度量标准,并识别可实现近乳完美识别的提示。我们的结果表明,文本到图像 leaderboard 的排名操纵比此前认识的更容易,凸显了需要更强防御的必要性。

关键词

引用

@article{arxiv.2510.06525,
  title  = {Text-to-Image Models Leave Identifiable Signatures: Implications for Leaderboard Security},
  author = {Ali Naseh and Anshuman Suri and Yuefeng Peng and Harsh Chaudhari and Alina Oprea and Amir Houmansadr},
  journal= {arXiv preprint arXiv:2510.06525},
  year   = {2025}
}

备注

Accepted at Lock-LLM Workshop, NeurIPS 2025