中文

AudioGenX:文本到音频生成模型的可解释性研究

声音 2025-10-20 v2 人工智能 机器学习 音频与语音处理

摘要

文本到音频生成模型(TAG)在根据文本描述生成音频方面取得了显著进展。然而,一个关键挑战在于,缺乏对每段文本输入如何影响生成音频的透明度。为此,我们引入AudioGenX,这是一种解释性人工智能(XAI)方法,通过突出显示输入标记的重要性,为文本到音频生成模型提供解释。AudioGenX通过利用事实与反事实目标函数来优化解释器,从而在音频标记层面提供可靠的解释。该方法能够提供关于文本输入与音频输出之间关系的详细而全面的理解,增强了TAG模型的可解释性和可信度。大量实验表明,AudioGenX在产生可靠解释方面效果显著,与现有方法相比,采用专为音频生成任务设计的新型评估指标进行基准测试。

关键词

引用

@article{arxiv.2502.00459,
  title  = {AudioGenX: Explainability on Text-to-Audio Generative Models},
  author = {Hyunju Kang and Geonhee Han and Yoonjae Jeong and Hogun Park},
  journal= {arXiv preprint arXiv:2502.00459},
  year   = {2025}
}

备注

14 pages