中文

用于DCASE2025任务6的AISTAT实验室系统:基于语言的音频检索

声音 2025-09-23 v1 人工智能 音频与语音处理

摘要

本报告介绍了AISTAT团队提交给DCASE 2025任务6中基于语言的音频检索任务的系统。我们提出的系统采用双编码器架构,其中音频和文本模态被分别编码,并使用对比学习对齐它们的表示。借鉴前一年挑战赛的方法,我们实现了一种蒸馏方法,并利用大语言模型(LLMs)进行有效的数据增强技术,包括回译和LLM混合。此外,我们引入了聚类以添加一个辅助分类任务进行进一步微调。我们最好的单一系统在Clotho开发测试集上达到了46.62的mAP@16,而四个系统的集成则达到了48.83的mAP@16。

关键词

引用

@article{arxiv.2509.16649,
  title  = {AISTAT lab system for DCASE2025 Task6: Language-based audio retrieval},
  author = {Hyun Jun Kim and Hyeong Yong Choi and Changwon Lim},
  journal= {arXiv preprint arXiv:2509.16649},
  year   = {2025}
}

备注

5 pages, 1 figure, DCASE2025 Task2 technical report