AudioTime:一个时间对齐的音频-文本基准数据集
声音
2024-07-04 v1 音频与语音处理
摘要
近期的音频生成技术进展使得能够从自由形式的文本描述中创建高保真音频片段成为可能。然而,时间关系——这是音频内容的关键特征——在主流模型中仍未得到充分代表,导致对时间可控性不够精确。具体而言,用户无法使用自由形式的文本准确控制声音事件的时间戳。我们认识到一个重要因素是缺乏高质量、时间对齐的音频-文本数据集,这些数据集对于训练具有时间控制能力的模型至关重要。越时间对齐的注释,模型就能更好地理解音频输出与时间文本提示之间的精确关系。因此,我们提出了一个强对齐的音频-文本数据集 AudioTime。它提供了丰富时间信息的文本注释,包括时间戳、持续时间、频率和排序,几乎涵盖了时间控制的所有方面。此外,我们提供了全面的测试集和评估指标,用于评估各种模型的时间控制性能。示例可在 https://zeyuxie29.github.io/AudioTime/ 上查看。
引用
@article{arxiv.2407.02857,
title = {AudioTime: A Temporally-aligned Audio-text Benchmark Dataset},
author = {Zeyu Xie and Xuenan Xu and Zhizheng Wu and Mengyue Wu},
journal= {arXiv preprint arXiv:2407.02857},
year = {2024}
}