评估 LLM 的隐藏风险:关于鲁棒性、一致性与可信度的实证研究
机器学习
2023-08-31 v4 人工智能
摘要
大型语言模型(LLMs)近期的普及对众多领域产生了重大影响,特别是通过其开放的生态系统,如 API、开源模型和插件。然而,随着其广泛部署,目前普遍缺乏对潜在隐藏风险进行深入讨论和分析的研究。在此背景下,我们打算开展一项初步但具有开创性的研究,涵盖 LLM 系统的鲁棒性、一致性和可信度。鉴于 LLM 时代的大部分相关文献尚属空白,我们提出了一种自动化工作流,以应对大量扩增的查询/响应。总体而言,我们对包括 ChatGPT、LLaMA 和 OPT 在内的主流 LLM 进行了超过一百万次查询。我们工作流的核心由一个数据原语组成,随后是一个自动化解释器,用于在不同的对抗性度量系统下评估这些 LLM。结果,我们得出了几个在该热门社区中相当罕见的、或许令人遗憾的结论。简而言之,它们是: 用户生成的查询输入中出现的微小但不可避免的错误,有可能偶然导致 LLM 产生意料之外的响应; LLM 在处理语义相似的查询输入时表现出较差的一致性。此外,作为一个附带发现,我们发现即使输入在极端程度上被污染,ChatGPT 仍然能够给出正确答案。虽然这一现象展示了 LLM 强大的记忆能力,但也引发了对在学术发展中使用此类数据进行涉及 LLM 评估的严重担忧。为了解决这一问题,我们提出了一种与数据集相关的新型指标,用于粗略判断使用此类数据进行涉及 LLM 评估的可行性。大量的实证研究支持上述结论。
引用
@article{arxiv.2305.10235,
title = {Assessing Hidden Risks of LLMs: An Empirical Study on Robustness, Consistency, and Credibility},
author = {Wentao Ye and Mingfeng Ou and Tianyi Li and Yipeng chen and Xuetao Ma and Yifan Yanggong and Sai Wu and Jie Fu and Gang Chen and Haobo Wang and Junbo Zhao},
journal= {arXiv preprint arXiv:2305.10235},
year = {2023}
}