音频-文本对比零样本学习中的类别可分性陷阱
声音
2025-09-29 v1 机器学习
音频与语音处理
摘要
音频-文本跨模态对比学习的最新进展显示了其在零样本学习方面的潜力。一种可能性是通过将来自预训练骨干神经网络的条目嵌入投影到一个跨模态空间中,在该空间中可以在任一域中计算条目相似度。这个过程依赖于骨干网络的强单模态预训练,以及投影仪的数据密集型训练任务。这两个过程可能因无意的数据泄露而产生偏差,这种泄露可能源于在预训练中使用监督学习,或无意中使用零样本学习评估的标签训练跨模态投影。在本研究中,我们表明,测量的零样本学习准确率很大一部分归因于从音频和文本骨干网络继承的优势,即它们不是在跨模态域中学习的,也不是从一种模态转移到另一种模态的。
引用
@article{arxiv.2408.13068,
title = {On Class Separability Pitfalls In Audio-Text Contrastive Zero-Shot Learning},
author = {Tiago Tavares and Fabio Ayres and Zhepei Wang and Paris Smaragdis},
journal= {arXiv preprint arXiv:2408.13068},
year = {2025}
}