面向野生动物广告的灵活且可扩展的网络收集方法
信息检索
2024-07-29 v1 数据库
摘要
野生动物走私者日益通过 cyberspace 开展其活动。作为他们在线上市场广告并出售野生动物产品,他们留下了数字痕迹。这为一个新的机会提供了可能:通过分析这些痕迹,我们可以获得有关走私网络如何运作以及如何被破坏的见解。然而,收集此类信息并不容易。线上市场出售大量商品,识别实际涉及野生动物的广告是一项复杂且难以自动化的任务。此外,鉴于数据量惊人,我们需要可扩展的机制来获取、筛选和存储广告,并使其可用于分析。本文提出了一种大规模收集野生动物走私数据的方法。我们提出一种数据收集管道,将受限爬虫用于数据发现与获取,结合基础模型和机器学习分类器以识别相关广告。我们描述的使用该管道创建的数据集,据称是其类中最大的:包含来自 41 个市场近百万条广告,覆盖 235 种物种和 20 种语言。源代码已公开于 \url{https://github.com/VIDA-NYU/wildlife_pipeline}。
引用
@article{arxiv.2407.18898,
title = {A Flexible and Scalable Approach for Collecting Wildlife Advertisements on the Web},
author = {Juliana Barbosa and Sunandan Chakraborty and Juliana Freire},
journal= {arXiv preprint arXiv:2407.18898},
year = {2024}
}