中文

基于支持向量正则化的音频-文本对比学习中的优化轨迹控制方法——SupCLAP

声音 2026-02-03 v2 人工智能

摘要

对比式语言-音频预训练旨在统一多模态表示于共享嵌入空间,已成为从跨模态检索到前沿多模态大型语言模型等众多应用的基石。然而,我们发现负样本推力的垂直分量是一种双刃剑:它包含来自负样本的丰富补充信息,但其不受约束的性质导致优化轨迹漂移和训练不稳定。为此,我们提出了支持向量正则化(Support Vector Regularization, SVR)方法,引入辅助支持向量以控制此垂直分量,旨在发掘其丰富信息的同时缓解相关的轨迹漂移。SVR 的有效性严重依赖其语义半径,该半径我们探索了两种无监督建模策略:直接参数化和增强约束以提高预测准确性的自适应半径预测模块。大量实验结果表明,我们的方法在标准音频-文本数据集上的分类、单语言检索和多语言检索任务中均优于广泛使用的基线方法,如 InfoNCE 和 SigLIP。 两者理论分析和针对优化轨迹漂移的实验结果均验证了 SVR 方法的正确性和有效性。值得注意的是,我们的方法高度高效,无需额外的训练数据或推理计算,仅添加极少的训练开销。

关键词

引用

@article{arxiv.2509.21033,
  title  = {SupCLAP: Controlling Optimization Trajectory Drift in Audio-Text Contrastive Learning with Support Vector Regularization},
  author = {Jiehui Luo and Yuguo Yin and Yuxin Xie and Jinghan Ru and Xianwei Zhuang and Minghua He and Aofan Liu and Zihan Xiong and Dongchao Yang},
  journal= {arXiv preprint arXiv:2509.21033},
  year   = {2026}
}