何时破例:探索语言模型作为人类道德判断的刻画
计算与语言
2022-10-28 v3 人工智能
计算机与社会
机器学习
摘要
AI 系统正日益与人类生活交织。为有效与人类协作并确保安全,AI 系统需要能够理解、解释并预测人类的道德判断与决策。人类道德判断常受规则引导,但并非总是如此。AI 安全的核心挑战之一是捕捉人类道德心智的灵活性——即判断何时应当打破规则的能力,尤其在新颖或异常情境中。本文提出一个受近期道德心理学研究启发的新型挑战集,包含涉及潜在可允许破例的破例问答(RBQA)案例。以最先进的大语言模型(LLM)为基础,我们提出一种新型道德思维链(MORALCOT)提示策略,将 LLM 的优势与认知科学中发展的道德推理理论相结合以预测人类道德判断。MORALCOT 以 6.2% 的 F1 优于七个现有 LLM,表明对人类推理建模可能是捕捉人类道德心智灵活性所必需的。我们还进行了详细的错误分析,为未来利用 RBQA 提升 AI 安全的工作指明方向。我们的数据发布于 https://huggingface.co/datasets/feradauto/MoralExceptQA,代码发布于 https://github.com/feradauto/MoralCoT
引用
@article{arxiv.2210.01478,
title = {When to Make Exceptions: Exploring Language Models as Accounts of Human Moral Judgment},
author = {Zhijing Jin and Sydney Levine and Fernando Gonzalez and Ojasv Kamal and Maarten Sap and Mrinmaya Sachan and Rada Mihalcea and Josh Tenenbaum and Bernhard Schölkopf},
journal= {arXiv preprint arXiv:2210.01478},
year = {2022}
}
备注
NeurIPS 2022 Oral