探索与引导大语言模型的道德指南针
人工智能
2024-06-07 v2 计算与语言
摘要
大语言模型 (LLM) 已成为推动各领域自动化与决策的核心,这引发了重大的伦理问题。本研究提出对最先进的 LLM 进行全面的比较分析,以评估其道德特征。我们将多个 SOTA 模型置于一系列伦理困境中,发现所有专有模型主要倾向于功利主义,而所有开放权重模型主要契合基于价值观的伦理。此外,在使用道德基础问卷时,我们探测的所有模型——除 Llama 2-7B 外——均表现出强烈的自由主义偏见。最后,为了对其中一个研究模型进行因果干预,我们提出了一种新的特定相似度激活引导技术。使用该方法,我们能够可靠地将模型的道德指南针引导至不同的伦理学派。所有这些结果表明,已部署的 LLM 中存在伦理维度,而这一方面通常被忽视。
引用
@article{arxiv.2405.17345,
title = {Exploring and steering the moral compass of Large Language Models},
author = {Alejandro Tlaie},
journal= {arXiv preprint arXiv:2405.17345},
year = {2024}
}