ANIRA:面向实时音频应用的神经网络推理架构
声音
2025-06-17 v1 人工智能
机器学习
音频与语音处理
信号处理
摘要
当前许多神经网络推理工具并不满足实时音频应用的需求。为此,我们引入 anira,一个高效的跨平台库。为确保与广泛的神经网络架构和框架兼容,anira 支持 ONNX Runtime、LibTorch 和 TensorFlow Lite 作为后端。每种推理引擎都存在实时违规,anira 通过将推理从音频回调解耦到静态线程池中来缓解此问题。该库集成了内置的延迟管理和广泛的基准测试功能,这些功能对于确保连续信号流至关重要。随后,对三种用于音频效果仿真的不同神经网络架构进行了 various configurations 下的基准测试。统计建模用于识别各种因素对性能的影响。研究结果表明,对于无状态模型,ONNX Runtime 的运行时间最低;对于有状态模型,LibTorch 的性能最快。我们的结果还表明,对于某些模型-引擎组合,初始推理耗时更长,尤其是当这些推理更频繁地出现实时违规时。
引用
@article{arxiv.2506.12665,
title = {ANIRA: An Architecture for Neural Network Inference in Real-Time Audio Applications},
author = {Valentin Ackva and Fares Schulz},
journal= {arXiv preprint arXiv:2506.12665},
year = {2025}
}
备注
8 pages, accepted to the Proceedings of the 5th IEEE International Symposium on the Internet of Sounds (2024) - repository: github.com/anira-project/anira