中文

音频字幕能否用图像字幕指标评价?

声音 2022-01-28 v2 计算与语言 音频与语音处理

摘要

自动音频字幕旨在为音频片段生成文本描述。为评价所生成音频字幕的质量,以往工作直接采用 SPICE 和 CIDEr 等图像字幕指标,而未论证其在该新领域的适用性,这可能误导先进模型的发展。由于缺乏关于字幕质量的人类判断数据集,该问题仍未被研究。因此,我们首先构建了两个评测基准 AudioCaps-Eval 和 Clotho-Eval。它们以成对比较而非绝对评分建立,以获得更好的标注者间一致性。我们发现当前指标在这些数据集上与人类标注的相关性很差。为克服其局限,我们提出名为 FENSE 的指标,其中结合了 Sentence-BERT 在捕捉相似性方面的优势,以及一种新颖的误差检测器以惩罚错误句子从而提升鲁棒性。在新建立的基准上,FENSE 比当前指标准确率高出 14–25%。代码、数据与网页演示见:https://github.com/blmoistawinde/fense

关键词

引用

@article{arxiv.2110.04684,
  title  = {Can Audio Captions Be Evaluated with Image Caption Metrics?},
  author = {Zelin Zhou and Zhiling Zhang and Xuenan Xu and Zeyu Xie and Mengyue Wu and Kenny Q. Zhu},
  journal= {arXiv preprint arXiv:2110.04684},
  year   = {2022}
}

备注

ICASSP 2022