中文

生成式文本到音频扩散模型能耗分析:责任的扩散

音频与语音处理 2025-07-17 v2 人工智能 机器学习 声音

摘要

文本到音频模型最近涌现为强大的从文本描述生成声音的技术,但其高计算需求引发了能源消耗和环境影响的担忧。本文我们对 7 种最新文本到音频基于扩散的生成模型进行能耗分析,评估不同生成参数在推理阶段的能耗影响。我们也旨在通过考虑所有所选模型的 Pareto 最优解,识别音频质量与能耗之间的最佳平衡。我们的发现为增强生成音频模型的性能与环境影响之间的权衡提供了见解,为开发更高效的生成音频模型作出了贡献。

关键词

引用

@article{arxiv.2505.07615,
  title  = {Diffused Responsibility: Analyzing the Energy Consumption of Generative Text-to-Audio Diffusion Models},
  author = {Riccardo Passoni and Francesca Ronchini and Luca Comanducci and Romain Serizel and Fabio Antonacci},
  journal= {arXiv preprint arXiv:2505.07615},
  year   = {2025}
}

备注

Accepted at WASPAA 2025