音频-文本模型尚未利用自然语言
声音
2023-03-21 v1 音频与语音处理
摘要
音频-文本领域的多模态对比学习技术已迅速成为高度活跃的研究领域。大多数工作使用标准音频检索与分类基准进行评估,假设(i)这些模型能够利用自然语言中所含的丰富信息,且(ii)当前基准能够捕捉此类信息的细微差别。在本工作中,我们表明最先进的音频-文本模型尚未真正理解自然语言,尤其是诸如声音事件顺序或并发排序的上下文概念。我们的结果表明,现有基准不足以评估这些模型匹配音频与文本模态中复杂上下文的能力。我们提出了一种基于 Transformer 的架构,并表明与先前工作不同,在给定适当基准数据下,它能够建模文本与音频中声音事件的顺序关系。我们主张收集或生成额外的多样数据,以使未来研究能充分利用自然语言进行音频-文本建模。
引用
@article{arxiv.2303.10667,
title = {Audio-Text Models Do Not Yet Leverage Natural Language},
author = {Ho-Hsiang Wu and Oriol Nieto and Juan Pablo Bello and Justin Salamon},
journal= {arXiv preprint arXiv:2303.10667},
year = {2023}
}
备注
Copyright 2023 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works