修改版道德图灵测试中的人工智能代理归因
计算机与社会
2024-06-19 v1 人工智能
计算与语言
摘要
人工智能的进步引发关于人们是否将AI系统所作的道德评估视为类似于人类道德评估的重要问题。我们进行了修改版道德图灵测试(m-MTT),灵感来自Allen等人(2000)的提议,通过询问人们区分真实的人类道德评估与先进AI语言模型(GPT-4)所作的道德评估。代表性样本中的299名美国成年人首先对道德评估的质量进行评分,且在披露来源信息前进行评估。惊人的是,在几乎所有维度上(包括美德性、智能性和可信赖性),人们都将AI的道德推理质量评估为高于人类的,这符合Allen等人所称的比较mTT通过标准。随后,当被要求识别每项评估的来源(人类或计算机)时,人们的判断显著高于随机水平。尽管AI未通过此测试,但这并非由于其道德推理劣势,而是可能由于其 perceived 的优越性等其他因素。能够产生质量优于人类道德回应的语言模型的出现引发担忧,人们可能不加批判地接受来自AI的潜在有害道德指导。这种可能性凸显了在道德事务中需要围绕生成式语言模型设置保障措施的必要性。
引用
@article{arxiv.2406.11854,
title = {Attributions toward Artificial Agents in a modified Moral Turing Test},
author = {Eyal Aharoni and Sharlene Fernandes and Daniel J. Brady and Caelan Alexander and Michael Criner and Kara Queen and Javier Rando and Eddy Nahmias and Victor Crespo},
journal= {arXiv preprint arXiv:2406.11854},
year = {2024}
}
备注
23 pages, 0 figures, in press