开放数据的第四波?探索生成式 AI 场景的潜在格局
人工智能
2024-05-08 v1
摘要
自 2022 年底以来,生成式 AI 正迅速流行,广泛应用包括 ChatGPT、Gemini 和 Claude 等工具。生成式 AI 和大型语言模型(LLM)应用正在改变个人发现和获取数据及知识的方式。然而,开放数据与生成式 AI 之间错综复杂的关系,以及其巨大潜力(用于推动该领域创新)仍未得到充分探索。本白皮书旨在拆解开放数据与生成式 AI 的关系,并探讨开放数据的新第四波:开放数据是否变得可供 AI 使用?开放数据是否正朝着数据公民方法发展?生成式 AI 是否使开放数据更具对话性?生成式 AI 是否提高开放数据的质量和来源信息?为此,我们提供了新的情景格局框架。该框架概述了开放数据与生成式 AI 可能交汇的各种情景,以及为使开放数据准备好这些特定情景所需的数据质量和来源信息要求。这些情景包括:关联、适应、推理与洞察生成、数据增强和开放式探索。通过这一过程,我们发现,为了让数据持有者拥抱生成式 AI 以提高开放数据访问并从开放数据中获得更深层见解,他们首先必须在五个关键领域取得进展:提高透明度和文档性、维护数据质量和完整性、促进互操作性和标准、提高可访问性和可用性、并解决伦理问题。
引用
@article{arxiv.2405.04333,
title = {A Fourth Wave of Open Data? Exploring the Spectrum of Scenarios for Open Data and Generative AI},
author = {Hannah Chafetz and Sampriti Saxena and Stefaan G. Verhulst},
journal= {arXiv preprint arXiv:2405.04333},
year = {2024}
}
备注
58 pages