中文

刻意遗忘?对用于学术研究的YouTube搜索API的批判性审计

信息检索 2025-11-25 v3 人机交互 社会与信息网络

摘要

本文对YouTube数据API(v3)的搜索端点进行了批判性审计,该端点是学术研究中常用的工具。通过使用十一个查询在六个月内进行系统性每周搜索,我们识别了在完整性、代表性、一致性和偏差方面的主要局限性。我们的发现揭示了相关性和日期等排序参数在视频召回率和精确度方面的显著差异,相关性排序经常检索到大量偏离主题的视频。我们还观察到视频可发现性的严重时间衰减:给定时间段内可检索的视频数量在发布后的短短20-60天内急剧下降,尽管这些视频仍保留在平台上。这可能破坏依赖系统性数据收集的研究设计。此外,搜索结果缺乏一致性,相同的查询随时间推移会产生不同的视频集,从而损害了可复现性。一项关于欧洲议会选举的案例研究突显了这些问题如何影响研究结果。虽然本文提出了几种缓解策略,但结论是,该API的搜索功能可能优先考虑“新鲜度”而非全面检索,不足以支持稳健的学术研究,特别是涉及《数字服务法案》要求的研究。

关键词

引用

@article{arxiv.2506.11727,
  title  = {Forgetful by Design? A Critical Audit of YouTube's Search API for Academic Research},
  author = {Bernhard Rieder and Adrian Padilla and Oscar Coromina},
  journal= {arXiv preprint arXiv:2506.11727},
  year   = {2025}
}

备注

25 pages, 2 tables and 4 figures