基于课程增强的两阶段三元组损失训练用于音视检索
声音
2023-10-23 v1 计算机视觉与模式识别
信息检索
多媒体
音频与语音处理
摘要
跨模态检索模型利用三元组损失优化的潜力来学习鲁棒的嵌入空间。然而,现有方法通常在一遍训练中完成模型训练,忽视了优化过程中半困难三元组与困难三元组的区别。未区分半困难与困难三元组这一疏忽导致模型性能欠佳。本文引入一种根植于课程学习的新方法来解决该问题。我们提出一种两阶段训练范式,引导模型从半困难三元组到困难三元组的学习过程。在第一阶段,模型从低损失基准出发,使用一组半困难三元组进行训练。随后,在第二阶段,我们使用插值技术对嵌入进行增强。该过程识别出潜在的困难负样本,缓解了因困难三元组稀缺而导致高损失函数所引发的问题。我们的方法随后在增强嵌入空间中应用困难三元组挖掘以进一步优化模型。在两个音视数据集上开展的广泛实验结果表明,在 AVE 数据集上针对音视跨模态检索(AV-CMR)任务,相较当前最优方法 MSNSCA,平均平均精度(MAP)显著提升约 9.8%,表明了我们提出方法的有效性。
引用
@article{arxiv.2310.13451,
title = {Two-Stage Triplet Loss Training with Curriculum Augmentation for Audio-Visual Retrieval},
author = {Donghuo Zeng and Kazushi Ikeda},
journal= {arXiv preprint arXiv:2310.13451},
year = {2023}
}
备注
8 pages, 6 figures