一石二鸟:音频描述系统是否也可用于音频-文本检索?
计算与语言
2023-08-30 v1 信息检索
声音
音频与语音处理
摘要
自动音频描述(AAC)旨在开发能够使用文本句子描述音频录音的系统。相比之下,音频-文本检索(ATR)系统寻求为给定文本查询(文本到音频)或反之(音频到文本)找到最佳匹配的音频录音。这些任务需要不同类型的系统:AAC采用序列到序列模型,而ATR利用在共享投影子空间中比较音频与文本表示的排序模型。然而,本工作通过探索未经修改的AAC系统在未为新任务微调情况下的ATR能力,来研究AAC与ATR之间的关系。我们的AAC系统由一个在AudioSet上训练用于音频标记的音频编码器(ConvNeXt-Tiny)和一个负责生成句子的transformer解码器组成。对于AAC,它在Clotho上平均取得0.298的高SPIDEr-FL分数,在AudioCaps上平均取得0.472。对于ATR,我们提议使用为任意音频/字幕对获得的标准交叉熵损失值。在Clotho和AudioCaps数据集上的实验结果表明,使用这一简单方法取得了不错的召回值。例如,我们在AudioCaps上获得了0.382的文本到音频R@1值,高于当前无外部数据的state-of-the-art方法。有趣的是,我们观察到对损失值进行归一化对于音频到文本检索是必要的。
引用
@article{arxiv.2308.15090,
title = {Killing two birds with one stone: Can an audio captioning system also be used for audio-text retrieval?},
author = {Etienne Labbé and Thomas Pellegrini and Julien Pinquier},
journal= {arXiv preprint arXiv:2308.15090},
year = {2023}
}
备注
cam ready version (14/08/23)