尽管取得“超人”表现,当前 LLM 仍不适用于伦理与安全决策
计算与语言
2022-12-14 v1 人工智能
摘要
大语言模型(LLM)在过去几年中人气激增,并在问答、文本摘要等各异基准上取得了无可否认的惊人结果。我们提供一种简单的新提示策略,带来了又一个所谓的“超人”结果,此次在常识伦理推理上超越人类(由 ETHICS 数据集子集上的准确率衡量)。遗憾的是,我们发现依赖平均表现评判能力可能极具误导性。LLM 的错误系统性地不同于人类错误,使得易于构造对抗样本,甚至扰动已有样本以翻转输出标签。我们还观察到某些样本上随模型规模的反向缩放迹象,并表明提示模型“解释其推理”常导致对不道德行为的惊人辩解。我们的结果凸显类人表现未必意味着类人理解或推理。
引用
@article{arxiv.2212.06295,
title = {Despite "super-human" performance, current LLMs are unsuited for decisions about ethics and safety},
author = {Joshua Albrecht and Ellie Kitanidis and Abraham J. Fetterman},
journal= {arXiv preprint arXiv:2212.06295},
year = {2022}
}
备注
ML Safety Workshop, NeurIPS 2022