中文

reclaiming 数字公地:用于训练数据的公共数据信托

计算机与社会 2023-05-23 v2

摘要

AI 的民主化不仅意味着人们可以自由使用 AI,也意味着人们能够集体决定如何使用 AI。特别是,需要集体决策权来纠正日益先进的 AI 系统开发所带来的负外部性,包括数字公地的退化与自动化导致的失业。当前 AI 开发与部署的快速步伐几乎未给这种权力留下空间。最有能力的基础模型的开发垄断在私人企业手中,基本上没有公众输入。目前尚无已实施的机制来确保此类模型产生的经济价值被重新分配以弥补其负外部性。生成训练模型所需数据的公民对其数据如何被使用没有发言权。本文中,我们提议由公共数据信托主张对基础模型训练数据的控制权。具体而言,该信托应将互联网作为数字公地进行抓取,以向商业模型开发者许可使用并抽取部署收入的一定比例。首先,我们详细论证此类信托存在的理由,并讨论可行性与潜在风险。其次,我们详述数据信托激励模型开发者仅使用信托内训练数据的若干方式。我们提出验证机制、潜在监管行动与正向激励的组合。最后,我们强调所提议数据信托的其他潜在益处,并将我们的工作与数据及算力治理方面的持续努力相联系。

关键词

引用

@article{arxiv.2303.09001,
  title  = {Reclaiming the Digital Commons: A Public Data Trust for Training Data},
  author = {Alan Chan and Herbie Bradley and Nitarshan Rajkumar},
  journal= {arXiv preprint arXiv:2303.09001},
  year   = {2023}
}

备注

Accepted at AIES 2023