L3AC:迈向轻量级无损音频编解码器
声音
2025-08-18 v2 人工智能
摘要
神经音频编解码器近期因其能够压缩高保真音频并为生成建模提供离散 token 而受到关注。然而,主流方法通常依赖资源密集型模型和复杂的多量化器架构,限制了它们在实际应用中的实用性。在这项工作中,我们引入了 L3AC,这是一种轻量级神经音频编解码器,它通过利用单一量化器和高效架构来解决这些挑战。为了在最小化模型复杂度的同时增强重建保真度,L3AC 探索了精简的卷积网络和局部 Transformer 模块,以及 TConv——一种旨在捕获多个时间尺度上声学变化的新型结构。尽管设计紧凑,但在多个不同数据集上的大量实验表明,L3AC 匹配或超越了主流编解码器的重建质量,同时将计算开销降低了一个数量级。单量化器设计进一步增强了其对下游任务的适应性。源代码公开于 https://github.com/zhai-lw/L3AC。
关键词
引用
@article{arxiv.2504.04949,
title = {L3AC: Towards a Lightweight and Lossless Audio Codec},
author = {Linwei Zhai and Han Ding and Cui Zhao and fei wang and Ge Wang and Wang Zhi and Wei Xi},
journal= {arXiv preprint arXiv:2504.04949},
year = {2025}
}