探索音频-语言学习中的训练与测试时增强
声音
2023-05-24 v2 计算与语言
音频与语音处理
摘要
本文旨在揭示数据增强在音频-语言多模态学习中的影响,尽管其重要性,该方面尚未被探索。我们不仅在训练时也在测试时探索多种增强方法,发现恰当的数据增强可带来显著提升。具体而言,应用我们提出的音频-语言配对增强 PairMix(首个多模态音频-语言增强方法)在自动音频描述与音频-文本检索任务上均优于基线。为充分利用数据增强,我们还提出了用于测试时的多级测试时增强(Multi-TTA)。我们成功结合了所提两种方法与单模态增强,在音频描述上取得 47.5 SPIDEr,相对基线提升 18.2%。在音频-文本检索中,所提方法同样显示出性能改进。
引用
@article{arxiv.2210.17143,
title = {Exploring Train and Test-Time Augmentations for Audio-Language Learning},
author = {Eungbeom Kim and Jinhee Kim and Yoori Oh and Kyungsu Kim and Minju Park and Jaeheon Sim and Jinwoo Lee and Kyogu Lee},
journal= {arXiv preprint arXiv:2210.17143},
year = {2023}
}
备注
5 pages, 4 figures