基于Transformer的层次化对齐与解�odied跨模态表示的音频-文本检索
声音
2025-05-06 v2 音频与语音处理
摘要
现有大多数音频-文本检索(ATR)方法通常依赖单一层级的交互来关联音频与文本,限制了跨模态对齐能力,导致匹配效果不佳。本文提出一种新型ATR框架,采用双流Transformer结合层次化对齐(THA)模块,以识别音频与文本之间不同Transformer模块之间的多层级对应关系。此外,当前ATR方法主要关注学习全局层级表示,忽略了捕获细微细节以对应文本语义音频 occurrences的潜在价值。为弥合这一差距,我们引入一种解�odied跨模态表示(DCR)方法,将高维特征解�odied为紧凑的潜在因子,以把握细粒度的音频-文本语义关联。此外,我们开发了一种置信度感知(CA)模块,用于估计每个潜在因子对的置信度,并自适应聚合跨模态潜在因子,以实现局部语义对齐。实验表明,THA有效提升了ATR性能,DCR方法进一步带来持续的性能提升。
引用
@article{arxiv.2409.09256,
title = {Audio-text Retrieval with Transformer-based Hierarchical Alignment and Disentangled Cross-modal Representation},
author = {Yifei Xin and Zhihong Zhu and Xuxin Cheng and Xusheng Yang and Yuexian Zou},
journal= {arXiv preprint arXiv:2409.09256},
year = {2025}
}
备注
Accepted by Interspeech2024