中文

未闻之声的语言:探索大语言模型的音乐音色语义

计算与语言 2023-05-05 v3 声音 音频与语音处理

摘要

声音的语义维度在理解听觉感官体验的本质以及感知、语言和意义之间更广泛的关系中一直发挥着核心作用。据此,并鉴于近期大语言模型(LLMs)的激增,我们在此探究此类模型是否展现出类似于人类所观察到的感知语义组织。具体而言,我们提示 ChatGPT(一个基于最先进 LLM 的聊天机器人)在一组 20 个语义量表上对乐器声音进行评分。我们在独立对话中引发多个响应,类似于拥有多名人类评分者。ChatGPT 生成的语义轮廓仅与人类评分部分相关,但在诸如明亮度(明亮-暗淡)和音高高度(低沉-高亢)等已知的音乐声音心理物理维度上表现出稳健的一致性。探索性因子分析表明,聊天机器人与人类评分具有相同的潜在因子空间维度,但空间构型不同。出乎意料的是,聊天机器人表现出的内部变异性程度在量级上与人类评分相当。我们的工作凸显了 LLM 捕捉人类感官体验显著维度的潜力。

关键词

引用

@article{arxiv.2304.07830,
  title  = {The language of sounds unheard: Exploring musical timbre semantics of large language models},
  author = {Kai Siedenburg and Charalampos Saitis},
  journal= {arXiv preprint arXiv:2304.07830},
  year   = {2023}
}

备注

12 pages, 3 figures