中文

基于机器学习的自动机简化用于符号加速器

机器学习 2025-07-14 v1

摘要

符号加速器正在被广泛应用于诸如基因组学、自然语言处理和网络安全等领域的符号数据处理。然而,由于内存使用过度和路由复杂度,尤其是在针对大型集合时,这些加速器面临可扩展性问题。我们提出AutoSlim,一种基于机器学习的图简化框架,旨在减少基于非确定性有限自动机(NFA)构建的符号加速器的复杂度,这类加速器部署在基于FPGA的overlay平台上(如NAPOLY+)。AutoSlim使用随机森林分类来根据边缘得分和结构特征修剪低影响转换,显著减少自动机图的密度,同时保持语义正确性。与现有工具不同,AutoSlim针对带有加权转换的自动得分感知简化,实现高效的排序序列分析。我们评估了数据集(1K至64K节点)在NAPOLY+上的表现,包括延迟、吞吐量和资源使用等指标。AutoSlim在FPGA LUTs上实现了最高40%的减少,转换 pruning 超过30%,同时扩展到比现有基准大一个数量级的图。我们的结果还表明,硬件互连(fanout)对硬件成本影响巨大,而AutoSlim的简化有助于缓解资源膨胀。

关键词

引用

@article{arxiv.2507.08751,
  title  = {ML-Based Automata Simplification for Symbolic Accelerators},
  author = {Tiffany Yu and Rye Stahle-Smith and Darssan Eswaramoorthi and Rasha Karakchi},
  journal= {arXiv preprint arXiv:2507.08751},
  year   = {2025}
}