中文

文本到音频 AI 中的语义与符号互动:探索认知动力学与音乐互动

声音 2025-11-24 v1 音频与语音处理

摘要

本文探讨了人工智能 (AI) 中的文本到音频范式,考察其对音乐创作、解释与认知的变革性影响。我从结构主义和后结构主义视角出发,结合认知理论中的模式动力学和元认知理论,分析了当描述性自然语言提示被转化为细腻的声音对象时发生的复杂语义与符号互动。该研究分析了 AI 中介的音乐活动所涉及的认知动力学,包括模式吸收与调适、元认知反思以及建构性感知等过程。论文论证认为,文本到音频 AI 模型作为音乐意义的准对象,既稳定又颠覆传统形式,促进了新的聆听模式和审美反思。以 Udio 为主要案例研究,本文探讨了这些模型如何在语言提示与声音输出之间的边缌空间进行导航。这一过程不仅生成新的音乐表达,还促使听众参与批判性的“结构意识聆听”,鼓励对音乐结构、符号细微差别以及塑造我们音乐认知的社会文化语境进行更深入的理解。论文以反思文本到音频 AI 模型作为知识工具和准对象的潜力,促进了显著的音乐互动转变,邀请用户发展对音乐认知和文化基础更为细致的理解。

关键词

引用

@article{arxiv.2511.17429,
  title  = {Semantic and Semiotic Interplays in Text-to-Audio AI: Exploring Cognitive Dynamics and Musical Interactions},
  author = {Guilherme Coelho},
  journal= {arXiv preprint arXiv:2511.17429},
  year   = {2025}
}