我的自动音频描述系统真的那么差吗?spider-max:一种考量多个描述候选的评测指标
声音
2022-11-17 v1 机器学习
音频与语音处理
摘要
自动音频描述(AAC)旨在使用自然语言描述音频信号。AAC系统以音频信号为输入,输出自由形式的文本句子,称为描述。评估此类系统并非易事,因为表达同一含义的方式有很多。为此,人们使用若干互补指标,如BLEU、CIDEr、SPICE和SPIDEr,将单条自动描述与由人类标注者给出的一条或多条参考描述进行比较。然而,自动系统可以产生多个描述候选,例如通过在句子生成过程中引入随机性,或在解码时使用束搜索考虑各种竞争的假设描述。若从AAC系统终端用户的角度考虑,提供多条描述而非单条似乎更能带来多样性,类似于信息检索系统。在本工作中,我们探索在评测过程中考虑多条预测描述而非一条的可能性。为此,我们提出SPIDEr-max,该指标取若干描述候选得分中的最大SPIDEr值。为论证我们的指标,我们基于一个transformer系统在Clotho v2.1和AudioCaps上报告了实验。例如在AudioCaps上,该系统达到了SPIDEr-max值(5个候选)接近参考人类SPIDEr分数。
引用
@article{arxiv.2211.08983,
title = {Is my automatic audio captioning system so bad? spider-max: a metric to consider several caption candidates},
author = {Etienne Labbé and Thomas Pellegrini and Julien Pinquier},
journal= {arXiv preprint arXiv:2211.08983},
year = {2022}
}
备注
Workshop on Detection and Classification of Acoustic Scenes and Events (DCASE 2022), Nov 2022, Nancy, France