生成式 AI 与数字公共资源的未来:五个开放问题与知识空白
计算机与社会
2025-08-11 v1
摘要
生成式 AI(GenAI)的快速发展深受数字公共资源——由社区创建、共享与维护的大量免费开放在线内容——的支持。然而,随着财务负担加重、贡献减少以及 AI 模型与社区规范之间的偏离,这种关系正变得日益紧张。在进入 GenAI 时代的今天,必须审视生成式 AI、数字公共资源的可持续性以及当前 AI 开发实践公平性之间的相互依赖关系。我们突出了五个需要紧急关注的关键问题:1. 如何防止因个人转而依赖生成式 AI 获取信息而停止贡献,导致数字公共资源陷入供给不足的困境?2. 如何缓解因限制访问爬虫而导致开放网络关闭的风险?3. 如何更新技术标准和法律框架以反映托管常见内容组织的演变需求?4. 增加的合成内容对开放知识数据库有何影响,如何确保其完整性?5. 如何计量和分配为 AI 训练提供数据的基础设施与环境成本?我们强调,在 AI 开发中需要更负责任的实践,认识到数字公共资源不仅是内容,更是一种依赖于“commoning”实践——即制作、维护和保护共享开放资源的协作性和去中心化的知识治理形式。最终,我们的目标是激发关于生成式 AI 与数字公共资源交叉界面的讨论与研究,旨在发展一种“AI 公共资源”,以及支持数字公共资源长期健康的公共 AI 开发基础设施。
引用
@article{arxiv.2508.06470,
title = {Generative AI and the Future of the Digital Commons: Five Open Questions and Knowledge Gaps},
author = {Arman Noroozian and Lorena Aldana and Marta Arisi and Hadi Asghari and Renata Avila and Pietro Giovanni Bizzaro and Ramya Chandrasekhar and Cristian Consonni and Deborah De Angelis and Francesca De Chiara and Maria del Rio-Chanona and Melanie Dulong de Rosnay and Maria Eriksson and Frederic Font and Emilia Gomez and Valérian Guillier and Lisa Gutermuth and David Hartmann and Lucie-Aimée Kaffee and Paul Keller and Felix Stalder and Joao Vinagre and Denny Vrandečić and Amanda Wasielewski},
journal= {arXiv preprint arXiv:2508.06470},
year = {2025}
}