中文

在受控提示扰动下评估文本到音频生成系统的语义脆弱性

声音 2026-05-06 v2 人工智能

摘要

近期的文本到音频生成技术使得模型能够将自然语言描述翻译为多样化的音乐输出。然而, 这些系统在语义等价提示变体下的鲁棒性尚未得到广泛探讨。小幅语言变化可能导致生成音频发生显著变异, 这引发了实际应用中的可靠性问题。本研究在受控提示扰动下评估文本到音频系统的语义脆弱性。我们选取 MusicGen-small、MusicGen-large 和 Stable Audio 2.5 作为代表性模型, 并在最小词汇替换(MLS)、强度变化(IS)和结构重述(SR)下进行评估。该数据集包含 75 组提示, 旨在保持语义意图的同时引入局部语言变异。通过补充的谱、时序和语义相似性措施比较生成输出, 以实现跨多个表示层次的鲁棒性分析。实验结果表明, 大型模型在语义一致性方面取得了改进, 其中 MusicGen-large 在 MLS 下的余弦相似性达到 0.77, 在 IS 下达到 0.82。然而, 声学和时序分析揭示了所有模型在嵌入相似性保持较高时仍存在持续的发散。这些发现表明, 脆弱性主要源于语义到声学的实现过程, 而非多模态嵌入对齐。我们的研究引入了受控框架用于评估文本到音频生成的鲁棒性, 并强调在生成式音频系统中需要多层次稳定性评估。

关键词

引用

@article{arxiv.2603.13824,
  title  = {Evaluating Semantic Fragility in Text-to-Audio Generation Systems Under Controlled Prompt Perturbations},
  author = {Jiahui Wu},
  journal= {arXiv preprint arXiv:2603.13824},
  year   = {2026}
}

备注

8 pages, 4 figures