开放文本到音频模型的表达范围特征化
声音
2025-11-17 v1 人工智能
音频与语音处理
摘要
文本到音频模型是一种生成模型,针对给定的文本提示生成音频输出。虽然层级生成器及其创建功能内容(例如可玩性)在程序化生成内容(PCG)的大多数讨论中占主导地位,但倾向于让玩家产生情感共鸣的游戏往往将多种创意和多模态内容(例如音乐、声音、视觉、叙事语调)编织在一起,多模态模型也开始在此类目的上进行至少实验性的应用。然而,人们仍不清楚这些模型到底生成什么,以及其产生的变异性和保真度如何:音频是生成系统要针对的极其广泛的输出类别。在PCG社区中,已用于定量描述生成器输出空间的表达范围分析(ERA)主要用于水平生成器。本文将ERA适用于文本到音频模型,通过对特定固定提示的输出进行表达范围分析来使分析变得可行。通过对模型施加几个来自环境声分类(ESC-50)数据集的标准化提示进行实验。所得音频在关键声学维度(例如音高、响度和 timbre)上进行分析。更广泛地说,本文为基于ERA的生成音频模型的探索性评估提供了一个框架。
引用
@article{arxiv.2510.27102,
title = {Expressive Range Characterization of Open Text-to-Audio Models},
author = {Jonathan Morse and Azadeh Naderi and Swen Gaudl and Mark Cartwright and Amy K. Hoover and Mark J. Nelson},
journal= {arXiv preprint arXiv:2510.27102},
year = {2025}
}
备注
Accepted at the AAAI Conference on Artificial Intelligence and Interactive Digital Entertainment (AIIDE 2025)