中文

数据集工厂:面向生成式计算机视觉数据集的工具链

人工智能 2023-09-22 v1

摘要

生成式AI工作流严重依赖以数据为中心的任务——例如按标注字段、向量距离或自定义分类器产生的分数过滤样本。与此同时,计算机视觉数据集正迅速接近PB级体量,使数据整理变得困难。此外,数据准备的迭代性质需要稳健的数据集共享与版本控制机制,二者均难以临时实现。为解决这些挑战,我们提出一种“数据集工厂”方法,将样本及其元数据的存储与处理分离,并为机器学习团队和个体研究者实现大规模以数据为中心的操作。

关键词

引用

@article{arxiv.2309.11608,
  title  = {Dataset Factory: A Toolchain For Generative Computer Vision Datasets},
  author = {Daniel Kharitonov and Ryan Turner},
  journal= {arXiv preprint arXiv:2309.11608},
  year   = {2023}
}

备注

Presented at the datacomp.ai workshop at ICCV 2023