中文

评估英国政府作为 AI 数据提供者的当前角色的方法

计算机与社会 2024-12-23 v2 人工智能 信息检索

摘要

政府通常收集并管理大量高质量的公民与机构数据,英国政府正探索如何更好地发布和提供这些数据以惠及 AI 领域。然而,生成式 AI 训练语料库的组成仍是高度保密的,这使得制定数据共享计划困难。为此,我们构思了两种方法来评估英国政府数据在大语言模型(LLM)训练中的使用情况,并“透视”英国政府当前作为 AI 数据提供者的贡献。第一种方法是一种消融研究,利用 LLM 的“遗忘”功能,以检验英国政府网站信息对 LLM 及其在公民查询任务中的性能的重要性。第二种方法是一种信息泄露研究,以确定 LLM 是否了解英国政府开放数据计划中 data.gov.uk 上公布信息。我们的发现表明,英国政府网站是 AI 的重要数据来源(在不同主题领域差异较大),而 data.gov.uk 不是。本文作为技术报告,详细解释了上述实验的设计、机制与局限性。我们还附带一份针对 ODI 网站的非技术性报告,概述实验与关键发现,阐释其意义,并为英国政府在其寻求设计 AI 政策时提供一套可操作的建议。虽然我们聚焦于英国开放政府数据,但我们认为本文所述方法为解决 AI 训练语料库的不透明问题提供了可复现的方案,并为组织提供了评估并最大化其对 AI 开发贡献的框架。

关键词

引用

@article{arxiv.2412.09632,
  title  = {Methods to Assess the UK Government's Current Role as a Data Provider for AI},
  author = {Neil Majithia and Elena Simperl},
  journal= {arXiv preprint arXiv:2412.09632},
  year   = {2024}
}

备注

17 pages, 5 figures; v2 - incorporated editor feedback; for the accompanying, non-technical ODI report see https://theodi.org/insights/reports/the-uk-government-as-a-data-provider-for-ai