设备端人工智能是否已损坏且可被利用?评估小型语言模型中的信任与伦理
密码学与安全
2025-03-06 v2 人工智能
摘要
在本文中,我们首次研究了设备端人工智能(AI)的信任与伦理影响,重点关注适用于智能手机等个人设备的小型语言模型(SLM)。虽然设备端SLM相比云服务承诺了更强的隐私保护、更低的延迟和更好的用户体验,但我们认为它们也可能引入比服务器端对应模型更显著的风险和漏洞。作为信任评估研究的一部分,我们基于一个成熟的可信度测量框架,对最先进的设备端SLM与其服务器端对应模型进行了系统评估。结果表明,设备端SLM的可信度显著较低,尤其表现出更多的刻板印象、不公平和隐私侵犯行为。基于这些发现,我们随后使用一组描绘有害场景的不道德问题数据集进行了伦理评估研究。结果揭示了设备端SLM缺乏伦理保障,强调了其生成有害内容的能力。此外,通过使用潜在不道德的普通提示,设备端SLM无需任何越狱或提示工程即可生成有效响应,且无任何过滤,这证明了设备端SLM的安全防护失效和可被利用性。这些响应可被滥用于各种有害和不道德场景,如社会危害、非法活动、仇恨、自残、可被利用的钓鱼内容等,所有这些都表明这些设备端SLM的严重脆弱性和可被利用性。
引用
@article{arxiv.2406.05364,
title = {Is On-Device AI Broken and Exploitable? Assessing the Trust and Ethics in Small Language Models},
author = {Kalyan Nakka and Jimmy Dani and Nitesh Saxena},
journal= {arXiv preprint arXiv:2406.05364},
year = {2025}
}
备注
26 pages, 31 figures and 5 tables