道德模仿:大语言模型生成贴合政治身份的道德合理化说辞
计算与语言
2023-06-21 v2
摘要
大语言模型(LLMs)已展现出生成流畅文本的惊人能力,以及复现不良社会偏见的倾向。本研究考察基于Transformer的GPT-3/3.5与OPT系列LLMs是否会复现与美国政治群体相关的道德偏见,此系一种广义能力(本文称为道德模仿)的实例。借助道德基础理论的工具,表明这些LLMs确为道德模仿者。当以自由派或保守派政治身份提示时,模型生成反映相应道德偏见的文本。本研究还探讨了道德模仿与模型规模的关系,以及人类与LLM道德用词间的相似性。
引用
@article{arxiv.2209.12106,
title = {Moral Mimicry: Large Language Models Produce Moral Rationalizations Tailored to Political Identity},
author = {Gabriel Simmons},
journal= {arXiv preprint arXiv:2209.12106},
year = {2023}
}
备注
16 pgs incl. references, 8 figures