中文

跨文本、语音与视频的桥接数据来源差距

人工智能 2025-02-20 v2 计算与语言 计算机与社会 机器学习 多媒体

摘要

AI 的进步在很大程度上取决于训练数据的规模和质量。尽管如此,关于超越文本领域对众多已建立数据集属性的实证分析仍显不足。本文进行了规模最大、首次针对多个模态——流行文本、语音和视频数据集——的纵向审计,从详细的来源趋势和使用限制到地理和语言表示进行分析。我们的手动分析覆盖了近 4000 个公开数据集(1990-2024 年),涵盖 608 种语言、798 个来源、659 个组织以及 67 个国家。我们发现,多模态机器学习应用几乎全部转向网页抓取、合成数据和社交媒体平台(如 YouTube)作为训练集,自 2019 年起已超过所有其他来源。其次,通过追踪数据集的派生链,我们发现不足 33% 的数据集受到限制性许可,而超过 80% 的广泛使用的文本、语音和视频数据集中的来源内容携带非商业限制。最后,与公开 AI 训练数据中所代表语言和地理数量呈上升趋势相反,我们的审计显示,所测量的地理和多语言表示措施自 2013 年以来未显著改善其覆盖范围。我们认为,这一审计的广度使我们能够在生态系统层面上审查数据来源、限制和西方中心主义的趋势,并且对这些问题的可见性对于 AI 的负责任进步至关重要。作为促进数据集透明度和负责任使用的贡献,我们发布了整个多模态审计,允许实践者在文本、语音和视频之间追踪数据来源。

关键词

引用

@article{arxiv.2412.17847,
  title  = {Bridging the Data Provenance Gap Across Text, Speech and Video},
  author = {Shayne Longpre and Nikhil Singh and Manuel Cherep and Kushagra Tiwary and Joanna Materzynska and William Brannon and Robert Mahari and Naana Obeng-Marnu and Manan Dey and Mohammed Hamdy and Nayan Saxena and Ahmad Mustafa Anis and Emad A. Alghamdi and Vu Minh Chien and Da Yin and Kun Qian and Yizhi Li and Minnie Liang and An Dinh and Shrestha Mohanty and Deividas Mataciunas and Tobin South and Jianguo Zhang and Ariel N. Lee and Campbell S. Lund and Christopher Klamm and Damien Sileo and Diganta Misra and Enrico Shippole and Kevin Klyman and Lester JV Miranda and Niklas Muennighoff and Seonghyeon Ye and Seungone Kim and Vipul Gupta and Vivek Sharma and Xuhui Zhou and Caiming Xiong and Luis Villa and Stella Biderman and Alex Pentland and Sara Hooker and Jad Kabbara},
  journal= {arXiv preprint arXiv:2412.17847},
  year   = {2025}
}

备注

ICLR 2025. 10 pages, 5 figures (main paper)