自动音频描述与基于语言的音频检索
声音
2023-05-16 v2 计算与语言
信息检索
音频与语音处理
摘要
本项目参与了DCASE 2022竞赛(任务6),该任务包含两个子任务:(1) 自动音频描述(Automated Audio Captioning)与 (2) 基于语言的音频检索(Language-Based Audio Retrieval)。第一个子任务涉及为音频样本生成文本描述,而第二个子任务的目标是在固定数据集中找到与给定描述匹配的音频样本。两个子任务均使用了Clotho数据集。模型在音频描述上以BLEU1、BLEU2、BLEU3、ROUGEL、METEOR、CIDEr、SPICE与SPIDEr分数评估,在音频检索上以R1、R5、R10与mARP10分数评估。我们进行了一系列修改这些任务基线模型的实验。我们用于自动音频描述的最终架构性能接近基线,而我们的基于语言的音频检索模型已超越其对应基线。
引用
@article{arxiv.2207.04156,
title = {Automated Audio Captioning and Language-Based Audio Retrieval},
author = {Clive Gomes and Hyejin Park and Patrick Kollman and Yi Song and Iffanice Houndayi and Ankit Shah},
journal= {arXiv preprint arXiv:2207.04156},
year = {2023}
}
备注
DCASE 2022 Competition (Task 6)