基于内存内处理的数据聚合可视化系统
计算机视觉与模式识别
2025-03-12 v1
摘要
聚合查询的数据可视化是数据探索和数据科学中最常见的方式之一,因为它可以帮助识别数据中的相关性和模式。我们提出DIVAN,一个通过频率对一维轴进行自动归一化以生成大量二维可视化的系统。DIVAN通过分箱对输入数据进行归一化,为数据集中出现更频繁的数据值分配更多像素。DIVAN可以利用CPU或内存内处理(PIM)架构快速计算聚合以支持可视化。在真实数据集上,我们展示了DIVAN生成的可视化能够突出显示模式和相关性,其中有些是预期的,有些是意外的。通过使用PIM,我们在大数据集上计算聚合的速度比现代CPU快45%-64%。对于拥有1亿行和32列的用例,我们的系统能够在一分钟内计算4960个聚合(每个大小为128×128×128)。
引用
@article{arxiv.2503.08463,
title = {A Data Aggregation Visualization System supported by Processing-in-Memory},
author = {Junyoung Kim and Madhulika Balakumar and Kenneth Ross},
journal= {arXiv preprint arXiv:2503.08463},
year = {2025}
}
备注
13 pages, 11 figures