算法学习人类价值观与非理性行为的风险
人工智能
2022-03-02 v2
摘要
为使人工智能(AI)与人类价值观(或人类偏好)对齐,它必须首先学习这些价值观。基于人类行为训练的 AI 系统,有可能将人类的非理性行为误判为人类价值观,并进而针对这些非理性行为进行优化。仅仅学习人类价值观同样存在风险:学习这些价值观的 AI 不可避免地也会获取关于人类非理性行为以及人类行为/策略的信息。这两者都可能带来危险:知晓人类策略可使 AI 在总体上变得更强大(无论其是否部分对齐或完全不对齐),而学习人类非理性行为则使其能够在无需提供对等价值的情况下利用人类。本文分析了开发能够学习人类非理性行为与人类策略的人工智能所带来的危险,并构建了一个具有不同层次人类偏见、人类策略与人类价值观信息的模型推荐系统。结论指出,无论 AI 的能力与知识如何,知晓人类非理性行为比知晓人类价值观更具危险性。因此,让 AI 直接学习人类价值观,而非先学习人类偏见再从行为中推导价值观,是更优的选择。
引用
@article{arxiv.2202.13985,
title = {The dangers in algorithms learning humans' values and irrationalities},
author = {Rebecca Gorman and Stuart Armstrong},
journal= {arXiv preprint arXiv:2202.13985},
year = {2022}
}