用于DCASE2025任务6的AISTAT实验室系统:基于语言的音频检索
声音
2025-09-23 v1 人工智能
音频与语音处理
摘要
本报告介绍了AISTAT团队提交给DCASE 2025任务6中基于语言的音频检索任务的系统。我们提出的系统采用双编码器架构,其中音频和文本模态被分别编码,并使用对比学习对齐它们的表示。借鉴前一年挑战赛的方法,我们实现了一种蒸馏方法,并利用大语言模型(LLMs)进行有效的数据增强技术,包括回译和LLM混合。此外,我们引入了聚类以添加一个辅助分类任务进行进一步微调。我们最好的单一系统在Clotho开发测试集上达到了46.62的mAP@16,而四个系统的集成则达到了48.83的mAP@16。
引用
@article{arxiv.2509.16649,
title = {AISTAT lab system for DCASE2025 Task6: Language-based audio retrieval},
author = {Hyun Jun Kim and Hyeong Yong Choi and Changwon Lim},
journal= {arXiv preprint arXiv:2509.16649},
year = {2025}
}
备注
5 pages, 1 figure, DCASE2025 Task2 technical report