MLC 数据的 FAIR 化
机器学习
2022-11-24 v1 人工智能
计算机与社会
摘要
多标签分类(MLC)任务日益受到机器学习(ML)界的关注,文献中涌现的论文与方法数量不断增长即为明证。因此,为确保恰当、正确、稳健且可信的基准测试,对该领域的进一步发展至关重要。我们认为,这可以通过遵循近期涌现的数据管理标准来实现,例如 FAIR(可发现、可访问、可互操作、可重用)与 TRUST(透明、负责、以用户为中心、可持续、技术)原则。为使 MLC 数据集 FAIR 化,我们引入了一个基于本体、遵循这些原则的 MLC 数据集在线目录。该目录以易懂的元特征、MLC 特定的语义描述以及不同的数据溯源信息广泛描述了众多 MLC 数据集。该 MLC 数据目录在我们近期发表于 Nature Scientific Reports 的 Kostovska & Bogatinovski 等人的论文中有详尽描述,并可访问:http://semantichub.ijs.si/MLCdatasets。此外,我们提供了一个基于本体的系统,用于便捷访问与查询来自一项全面 MLC 基准研究所得的性能/基准数据。该系统可访问:http://semantichub.ijs.si/MLCbenchmark。
引用
@article{arxiv.2211.12757,
title = {FAIRification of MLC data},
author = {Ana Kostovska and Jasmin Bogatinovski and Andrej Treven and Sašo Džeroski and Dragi Kocev and Panče Panov},
journal= {arXiv preprint arXiv:2211.12757},
year = {2022}
}
备注
This paper was accepted ECML PKDD 2022