语言模型在遵循提示上比人类更差吗?事情没那么简单
计算与语言
2023-11-14 v2 人工智能
摘要
提示(prompts)一直是推动语言模型零样本与少样本性能进展的核心。然而,近期研究发现,当给定故意无关或误导性的提示时,模型的表现可能出奇地好。此类结果或可被解读为模型行为并非“类人”的证据。在本研究中,我们挑战了此类工作中的一个核心假设:即人类在接收到病态指令时会表现糟糕。我们发现,人类能够可靠地忽略无关指令,从而像模型一样,在缺乏关于其所被要求任务的明确信号时,仍能在底层任务上表现良好。然而,当给定蓄意误导的指令时,人类会忠实地遵循指令,而模型则不会。我们的发现警示,未来研究不应将人类行为理想化为铁板一块,也不应在未首先通过实证验证人类行为的情况下,训练或评估模型去模仿关于这些行为的假设。
引用
@article{arxiv.2301.07085,
title = {Are Language Models Worse than Humans at Following Prompts? It's Complicated},
author = {Albert Webson and Alyssa Marie Loo and Qinan Yu and Ellie Pavlick},
journal= {arXiv preprint arXiv:2301.07085},
year = {2023}
}
备注
EMNLP 2023