基于跨模态注意力与混合损失的鲁棒音频-文本检索
计算与语言
2026-04-28 v1 声音
摘要
音频-文本检索旨在实现音频内容与自然语言查询之间的语义对齐,支持多媒体搜索、无障碍访问和监控等应用。然而,当前的SOTA方法依赖对比学习和大批量训练,难以处理长篇、噪声较大且标注不完整的音频。我们提出一种新型多模态检索框架,通过交叉模态嵌入细化模块(结合基于Transformer的投影、线性映射和双向注意力)来细化音频和文本嵌入。为进一步提升鲁棒性,我们引入混合损失函数,融合余弦相似度、 与对比目标,实现即使在小批量约束下也能稳定训练。我们的方案通过静音感知分块和注意力池化高效处理长时段且信噪比 (SNR) 在5至15之间的噪声音频。实验在基准数据集上表明我们的方法优于先前方法。
引用
@article{arxiv.2604.23323,
title = {Robust Audio-Text Retrieval via Cross-Modal Attention and Hybrid Loss},
author = {Meizhu Liu and Matthew Rowe and Amit Agarwal and Michael Avendi and Yassi Abbasi and Hitesh Laxmichand Patel and Paul Li and Kyu J. Han and Tao Sheng and Sujith Ravi and Dan Roth},
journal= {arXiv preprint arXiv:2604.23323},
year = {2026}
}