可信 AI:安全性、偏见与隐私——一项综述
密码学与安全
2025-06-12 v2 人工智能
计算与语言
机器学习
摘要
人工智能系统的能力已大幅提升,但这些系统仍然面临失效模式、漏洞和偏见等问题。在本文中,我们研究了当前领域的现状,并就挑战 AI 模型可信性的问题提出了有前景的见解和视角。特别地,本文探讨了三个方面的议题:安全性、隐私性和偏见,这些问题损害了模型的可信性。在安全性方面,我们讨论了大语言模型上下文中的安全对齐,防止其生成有毒或有害内容。在偏见方面,我们关注可能误导网络的虚假偏见。最后,在隐私方面,我们涵盖了深度神经网络中的成员推理攻击。本文所讨论的内容反映了我们自己的实验和观察。
引用
@article{arxiv.2502.10450,
title = {Trustworthy AI: Safety, Bias, and Privacy -- A Survey},
author = {Xingli Fang and Jianwei Li and Varun Mulchandani and Jung-Eun Kim},
journal= {arXiv preprint arXiv:2502.10450},
year = {2025}
}