高性能计算机声学数据加速器:一种用于大数据应用中海洋哺乳动物声学探索的新系统
分布式、并行与集群计算
2015-09-14 v1
摘要
本文提出了一种用于分布式声音信号检测运行时的新软件模型,该模型使用称为 DeLMA 的机器学习算法。同时还提出了一种新算法——声学数据挖掘加速器(ADA)。ADA 是一种稳健且可扩展的解决方案,利用分布式计算技术高效处理大型声音档案。DeLMA 与 ADA 算法共同提供了一个强大工具,目前正被康奈尔大学康奈尔鸟类学实验室的生物声学研究中心(BRP)所使用。本文提供该系统的高层技术概述,并讨论设计的各个方面。给出了基本运行时性能与项目摘要。DeLMA-ADA 基线性能对比桌面串行配置与 64 核分布式 HPC 系统,显示出高达 44 倍的运行时执行加速。在 HPC 上使用 48 核的性能测试显示,相比 4 核桌面方案有 9 至 12 倍的效率提升。19 个东海岸部署的项目摘要结果表明,迄今为止 DeLMA-ADA 方案已处理超过三百万通道小时的声学数据。
引用
@article{arxiv.1509.03591,
title = {High Performance Computer Acoustic Data Accelerator: A New System for Exploring Marine Mammal Acoustics for Big Data Applications},
author = {Peter Dugan and John Zollweg and Marian Popescu and Denise Risch and Herve Glotin and Yann LeCun and and Christopher Clark},
journal= {arXiv preprint arXiv:1509.03591},
year = {2015}
}
备注
Seven pages, submitted at International Conference on Machine Learning 2014, Workshop uLearnBio, unsupervised learning for bioacoustic applications