HUGO-CS:一种混合标注、不确定性感知、通用、观察性冷喷数据集
机器学习
2026-05-07 v1
摘要
冷喷涂作为一种固体态制造技术,因其在维修和制造组件方面的优势而日益受到关注。然而,由于存在许多相互依赖的参数以及缺乏大规模机器可读数据以支持建模,过程优化仍然困难。虽然科学文献中包含大量相关实验,但结果报告不一致(常以表格和图形形式呈现),且使用非统一的单位,限制了大规模利用。在针对这些限制方面,本工作提出了HUGO-CS,即一个来自文献的数据集,包含4383次冷喷实验,涉及144个特征,来自1124个来源,超过以往最大数据集(137个样本)的30倍。由于每次文档平均需要91分钟的完全手动抽取,本工作设计并利用一种混合标注、不确定性感知、通用、观察性抽取框架,称为HUGO,以支持此次抽取。HUGO将基于自动LLM标注的标签与针对性的手动标签细化相结合,以处理从科学文献中提取实验结果的过程。为在标注效率与抽取准确性之间取得平衡,HUGO引入了分层风险缓解(HRM),将潜在错误风险较高的LLM输出路由到手动审核,而保留低风险记录作为自动标注。最后,HUGO后处理整合分类描述符,将报告的喷涂料料浆化学组成映射到结构化的连续组成,并跨来源标准化单位。对于4383个报告的实验,其中1765个为手工标注,为基准测试、错误分析和更高保真度数据点提供了高质量的标注子集。所有代码以复制此工作,并发布完整的HUGO-CS数据集,均采用CC-BY许可证发布于https://github.com/sprice134/HUGO。
引用
@article{arxiv.2605.04257,
title = {HUGO-CS: A Hybrid-Labeled, Uncertainty-Aware, General-Purpose, Observational Dataset for Cold Spray},
author = {Stephen Price and Kyle Miller and Marco Musto and Kenneth Kroenlein and James Saal and Kyle Tsaknopoulos and Elke A. Rundensteiner and Danielle L. Cote},
journal= {arXiv preprint arXiv:2605.04257},
year = {2026}
}
备注
22 pages, 8 figures, 4 tables