Cacophony:一种改进的对比音频-文本模型
声音
2024-10-01 v3 音频与语音处理
摘要
尽管近期取得了进展,音频-文本模型在规模和性能上仍落后于其图像-文本对应物。在本文中,我们提出改进音频-文本对比模型的数据规模和训练流程。具体而言,我们构建了一个包含13,000小时带文本标注音频的大规模音频-文本数据集,使用预训练语言模型处理嘈杂的文本描述,并使用自动字幕生成技术为无标签音频样本获取文本描述。我们首先使用掩码自编码器(MAE)目标在纯音频数据上进行训练,这使我们能够从无标签音频数据集的可扩展性中受益。然后,我们使用辅助字幕生成目标训练对比模型,并将音频编码器从MAE模型进行初始化。我们最终命名为Cacophony的模型在音频-文本检索任务上取得了SOTA性能,并在HEAR基准和零样本分类等其他下游任务上表现出有竞争力的结果。
引用
@article{arxiv.2402.06986,
title = {Cacophony: An Improved Contrastive Audio-Text Model},
author = {Ge Zhu and Jordan Darefsky and Zhiyao Duan},
journal= {arXiv preprint arXiv:2402.06986},
year = {2024}
}
备注
Accepted at IEEE/ACM Transactions on Audio, Speech, and Language Processing