中文

基于数据种子标注图像的面向视觉模型的同级排序精度

机器学习 2025-06-13 v3 人工智能 计算机视觉与模式识别

摘要

现代人工智能模型,特别是计算机视觉和图像生成任务中使用的扩散模型,正在发生开发方法范式的转变。传统上以“模型中心主义”方法为主,通过不断复杂化模型架构和优化超参数来追求性能提升,然而该领域正越来越认识到更为细致的“数据中心主义”方法。这种新兴框架将训练数据的质量、结构和相关性置于性能驱动力的首位。为实现这一范式转变,我们引入 DataSeeds.AI 样本数据集(简称 DSD),最初包含约 10,610 张高质量的人类同级排序摄影图像,伴随详尽的多层级标注。DSD 是一个为商业图像数据集设计算术新标准的基础计算机视觉数据集。作为 DataSeeds.AI 1.0 亿以上图像目录中微小部分的代表,DSD 为稳健的商业和多模态 AI 开发提供了可扩展的基础。通过深入的探索性分析,我们记录了 DSD 在特定模型相对于已知基准上所产生的定量改进,并公开提供用于评估的代码和训练好的模型。

关键词

引用

@article{arxiv.2506.05673,
  title  = {Peer-Ranked Precision: Creating a Foundational Dataset for Fine-Tuning Vision Models from DataSeeds' Annotated Imagery},
  author = {Sajjad Abdoli and Freeman Lewin and Gediminas Vasiliauskas and Fabian Schonholz},
  journal= {arXiv preprint arXiv:2506.05673},
  year   = {2025}
}

备注

28 pages, 12 figures