中文

LEMUR神经网络数据集:面向无缝AutoML

机器学习 2025-09-25 v4 人工智能 计算机视觉与模式识别 数字图书馆

摘要

神经网络是现代人工智能的基石,但设计、评估和比较神经网络仍然耗费人力。虽然存在众多用于训练的数据集,但用于模型本身的标准化集合却寥寥。我们介绍LEMUR,这是一个开源数据集和框架,提供了跨分类、分割、检测和自然语言处理等任务的大型PyTorch神经网络集合。每个模型遵循统一模板,配置和结果存储在结构化数据库中,以确保一致性和可重复性。LEMUR集成了通过Optuna的自动化超参数优化,包含统计分析和可视化工具,提供API以便无缝访问性能数据。该框架可扩展,允许研究人员在不破坏兼容性的前提下添加新模型、数据集或指标。通过标准化实现并统一评估,LEMUR旨在加速AutoML研究,实现公平基准测试,减少大规模神经网络实验的门槛。为支持采用和合作,LEMUR及其插件均在MIT许可下发布,地址为:https://github.com/ABrain-One/nn-dataset https://github.com/ABrain-One/nn-plots https://github.com/ABrain-One/nn-vr

关键词

引用

@article{arxiv.2504.10552,
  title  = {LEMUR Neural Network Dataset: Towards Seamless AutoML},
  author = {Arash Torabi Goodarzi and Roman Kochnev and Waleed Khalid and Hojjat Torabi Goudarzi and Furui Qin and Tolgay Atinc Uzun and Yashkumar Sanjaybhai Dhameliya and Yash Kanubhai Kathiriya and Zofia Antonina Bentyn and Dmitry Ignatov and Radu Timofte},
  journal= {arXiv preprint arXiv:2504.10552},
  year   = {2025}
}