音频描述中的多任务学习:句子嵌入回归损失作为正则化器
声音
2023-05-03 v1 音频与语音处理
摘要
在这项工作中,我们提议研究以句子嵌入回归损失分量训练之模型在自动音频描述(Automated Audio Captioning)任务上的性能。该任务旨在构建能用自然语言单句描述音频内容的系统。多数系统以标准交叉熵损失训练,其未考虑句子间的语义接近性。我们发现添加句子嵌入损失项可减轻过拟合,并且在 AudioCaps 语料库的第一种设置中将 SPIDEr 从 0.397 提升至 0.418。当我们增大权重衰减值时,发现模型更接近当前 SOTA 方法,SPIDEr 分数最高达 0.444,而对比分数为 0.475。此外,该模型使用的可训练参数少八倍。在此训练设置下,句子嵌入损失对模型性能不再有影响。
引用
@article{arxiv.2305.01482,
title = {Multitask learning in Audio Captioning: a sentence embedding regression loss acts as a regularizer},
author = {Etienne Labbé and Julien Pinquier and Thomas Pellegrini},
journal= {arXiv preprint arXiv:2305.01482},
year = {2023}
}