用于研究的网络爬虫:法律、伦理、制度和科学考量
计算机与社会
2024-12-20 v2 社会与信息网络
摘要
各学科的科学家经常使用来自互联网的数据进行研究,从而产生关于人类行为的宝贵见解。然而,随着依赖海量文本语料库的生成式人工智能变得越来越有价值,平台已通过官方渠道极大地限制了数据访问。因此,研究人员可能会进行更多的网络爬虫来收集数据,这给研究人员带来了新的挑战和担忧。本文为美国研究人员的社会科学研究提出了一个全面的网络爬虫框架,考察了研究人员在爬取网络时应考虑的法律、伦理、制度和科学因素。我们概述了当前影响研究人员何时以及如何通过爬虫访问、收集、存储和共享数据的监管环境。然后,我们为研究人员提供建议,以科学合法且合乎伦理的方式进行爬虫。我们旨在为研究人员提供相关信息,以便在这种不断变化的数据访问环境中降低风险并最大化其研究的影响力。
引用
@article{arxiv.2410.23432,
title = {Web Scraping for Research: Legal, Ethical, Institutional, and Scientific Considerations},
author = {Megan A. Brown and Andrew Gruen and Gabe Maldoff and Solomon Messing and Zeve Sanderson and Michael Zimmer},
journal= {arXiv preprint arXiv:2410.23432},
year = {2024}
}