Operon:基于命名维度的碎片数据增量构造
编程语言
2025-11-21 v1 人工智能
机器学习
摘要
现代数据处理工作流程经常遇到碎片数据:即由可变长度元素组成的集合,这在自然语言处理、科学测量和自主AI智能体等领域中自然出现。现有工作流程引擎缺乏对碎片数据固有形状和依赖关系的跟踪功能,迫使用户手动管理复杂的索引和依赖关系。我们提出Operon,一个基于Rust的工作流程引擎,通过命名维度的新型形式和显式依赖关系来解决这些挑战。Operon提供了域特定语言,用户可声明带有维度注释的管道,这些管道在静态上进行正确性验证,而运行时系统则在执行期间动态调度任务,以数据形状的逐步发现为依据。我们形式化了关于部分形状的推理数学基础,并证明了Operon的增量构造算法在并行设置下保证确定性和一致性。该系统的显式建模使其具备健壮的持久化和恢复机制,而其按任务多队列体系结构实现了跨异构任务类型的高效并行。实证评估表明,Operon在基准开销降低14.94倍的同时,能够在规模扩大时保持接近线性的端到端输出率,特别适合机器学习应用中大规模数据生成管道。
引用
@article{arxiv.2511.16080,
title = {Operon: Incremental Construction of Ragged Data via Named Dimensions},
author = {Sungbin Moon and Jiho Park and Suyoung Hwang and Donghyun Koh and Seunghyun Moon and Minhyeong Lee},
journal= {arXiv preprint arXiv:2511.16080},
year = {2025}
}