概念位移评估AI训练与推理中的完整性与归因
密码学与安全
2025-07-17 v3 人工智能
机器学习
摘要
人工智能(AI)的日益普及加剧了关于可信度的关注,包括完整性、隐私、鲁棒性和偏见等问题。为评估和归因这些威胁,我们提出ConceptLens—a一种通用框架,利用预训练的多模态模型识别完整性威胁的根本原因,通过分析探针样本中的概念位移(Concept Shift)。ConceptLens在检测常规数据投毒攻击方面表现出强大的检测性能,并揭示了对偏见注入的脆弱性,如通过恶意概念位移生成隐蔽广告。它识别了未经修改但高风险样本的隐私风险,在训练前进行筛选,并提供关于因训练数据不完整或不平衡而导致的模型弱点的见解。此外,在模型层面,它识别出目标模型过度依赖的概念、识别误导性概念,并解释了如何通过破坏关键概念对模型产生负面影响。它还揭示了生成内容中的社会学偏见,显示不同社会学情境之间的差异。令人惊讶的是,ConceptLens揭示了安全的训练和推理数据如何可能被无意且轻易被利用,从而可能削弱安全对齐。我们的研究为培育AI系统可信度提供了可行的见解,从而加速采纳并推动更大的创新。
引用
@article{arxiv.2504.21042,
title = {What's Pulling the Strings? Evaluating Integrity and Attribution in AI Training and Inference through Concept Shift},
author = {Jiamin Chang and Haoyang Li and Hammond Pearce and Ruoxi Sun and Bo Li and Minhui Xue},
journal= {arXiv preprint arXiv:2504.21042},
year = {2025}
}
备注
Accepted to The ACM Conference on Computer and Communications Security (CCS) 2025