我是斯巴达克斯,不,我才是斯巴达克斯:测量与理解大语言模型的身份混淆
密码学与安全
2024-11-19 v1
摘要
大语言模型(LLM)在文本生成、数据分析和软件开发等多种任务中表现出色,使其在教育、商业和创意产业等领域不可或缺。然而,大语言模型的迅速普及(截至2024年,已有超过560家公司开发或部署)引发了对其原创性和可信度的担忧。一个被称为“身份混淆”的显著问题已经出现,即大语言模型会错误地表述其来源或身份。本研究通过三个研究问题系统地审视了身份混淆现象:(1)身份混淆在大语言模型中有多普遍?(2)它是由模型复用、抄袭还是幻觉引起的?(3)身份混淆对安全和信任有何影响?为解决这些问题,我们开发了一个自动化工具,结合了文档分析、自我身份识别测试和输出相似性比较——这些是已确立的大语言模型指纹识别方法——并通过 Credamo 平台进行了一项结构化调查,以评估其对用户信任的影响。我们对27个大语言模型的分析显示,25.93%的模型存在身份混淆。输出相似性分析证实,这些问题源于幻觉而非复制或复用。调查结果进一步强调,身份混淆显著侵蚀了信任,尤其是在教育和专业应用等关键任务中,其信任度下降幅度超过了由逻辑错误或不一致性引起的下降。用户将这些失败归因于设计缺陷、错误的训练数据以及感知到的抄袭,这凸显了身份混淆对大语言模型可靠性和可信度构成的系统性风险。
引用
@article{arxiv.2411.10683,
title = {I'm Spartacus, No, I'm Spartacus: Measuring and Understanding LLM Identity Confusion},
author = {Kun Li and Shichao Zhuang and Yue Zhang and Minghui Xu and Ruoxi Wang and Kaidi Xu and Xinwen Fu and Xiuzhen Cheng},
journal= {arXiv preprint arXiv:2411.10683},
year = {2024}
}
备注
16 pages, 8 figure, 6 tables